diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-100/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-100/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-100/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-100/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-100/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-100/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-100/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-100/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-100/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-100/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-100/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-100/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-100/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-100/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..20b406e63a1abf865fd144a322b34165c30817ec --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-100/trainer_state.json @@ -0,0 +1,139 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 0.24906600249066002, + "eval_steps": 20, + "global_step": 100, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 9823576763965440.0, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1000/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1000/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1000/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1000/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1000/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1000/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1000/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1000/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1000/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1000/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1000/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1000/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1000/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1000/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..dfe73a5743fcfda8d7ec364b883e78080a8ec471 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1000/trainer_state.json @@ -0,0 +1,1084 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 2.488169364881694, + "eval_steps": 20, + "global_step": 1000, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 9.859037950771814e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1020/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1020/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1020/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1020/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1020/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1020/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1020/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1020/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1020/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1020/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1020/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1020/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1020/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1020/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..5c462a907d1cc6701c162efe12def24544e8d019 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1020/trainer_state.json @@ -0,0 +1,1105 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 2.5379825653798256, + "eval_steps": 20, + "global_step": 1020, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.0076952699436032e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1040/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1040/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1040/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1040/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1040/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1040/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1040/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1040/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1040/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1040/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1040/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1040/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1040/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1040/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..907ef505bb00b812dd0a2e31186361269113de00 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1040/trainer_state.json @@ -0,0 +1,1126 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 2.587795765877958, + "eval_steps": 20, + "global_step": 1040, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.0254458345271091e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1060/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1060/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1060/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1060/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1060/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1060/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1060/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1060/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1060/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1060/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1060/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1060/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1060/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1060/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..7ec0e8941bdb4365303d4efa80f64f3787def7ee --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1060/trainer_state.json @@ -0,0 +1,1147 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 2.6376089663760895, + "eval_steps": 20, + "global_step": 1060, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.045743734380032e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1080/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1080/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1080/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1080/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1080/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1080/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1080/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1080/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1080/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1080/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1080/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1080/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1080/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1080/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..51cf569b8933e96ea4343c3d0f1ea233af51977f --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1080/trainer_state.json @@ -0,0 +1,1168 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 2.6874221668742218, + "eval_steps": 20, + "global_step": 1080, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.0682640451304448e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1100/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1100/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1100/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1100/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1100/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1100/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1100/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1100/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1100/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1100/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1100/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1100/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1100/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1100/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..a85b886556ea5dcc6d8507b8b863b00d9ecbd9ad --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1100/trainer_state.json @@ -0,0 +1,1189 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 2.7372353673723535, + "eval_steps": 20, + "global_step": 1100, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.0877774590688256e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1120/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1120/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1120/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1120/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1120/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1120/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1120/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1120/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1120/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1120/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1120/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1120/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1120/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1120/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..f5b41f15a345ccc37f07a171ccd3f0f644d342bc --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1120/trainer_state.json @@ -0,0 +1,1210 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 2.7870485678704857, + "eval_steps": 20, + "global_step": 1120, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.1058529480242586e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1140/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1140/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1140/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1140/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1140/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1140/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1140/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1140/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1140/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1140/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1140/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1140/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1140/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1140/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..50cc56468ed358108ec186f62f5a4ab62eeba058 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1140/trainer_state.json @@ -0,0 +1,1231 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 2.8368617683686175, + "eval_steps": 20, + "global_step": 1140, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.1277422592347136e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1160/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1160/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1160/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1160/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1160/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1160/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1160/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1160/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1160/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1160/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1160/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1160/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1160/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1160/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..e70755e11308cfb4149a322fc6f55d2ef901a1b4 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1160/trainer_state.json @@ -0,0 +1,1252 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 2.8866749688667497, + "eval_steps": 20, + "global_step": 1160, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.1472790102826803e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1180/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1180/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1180/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1180/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1180/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1180/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1180/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1180/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1180/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1180/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1180/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1180/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1180/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1180/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..6d0e7c0d0b440270b68b490316b86c1f3911c717 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1180/trainer_state.json @@ -0,0 +1,1273 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 2.936488169364882, + "eval_steps": 20, + "global_step": 1180, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.1675715246487757e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-120/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-120/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-120/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-120/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-120/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-120/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-120/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-120/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-120/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-120/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-120/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-120/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-120/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-120/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..c9cc6b9812fd08b33630c2d416efe72e5b1ff015 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-120/trainer_state.json @@ -0,0 +1,160 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 0.298879202988792, + "eval_steps": 20, + "global_step": 120, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.1745836528934912e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1200/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1200/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1200/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1200/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1200/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1200/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1200/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1200/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1200/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1200/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1200/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1200/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1200/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1200/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..59934fc7363f00f56f46062daaca05db1ad179c9 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1200/trainer_state.json @@ -0,0 +1,1294 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 2.9863013698630136, + "eval_steps": 20, + "global_step": 1200, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.1868291279628493e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1220/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1220/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1220/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1220/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1220/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1220/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1220/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1220/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1220/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1220/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1220/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1220/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1220/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1220/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..95a5ab0ac38c50b53455bdfd6811db6319d068a8 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1220/trainer_state.json @@ -0,0 +1,1315 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 3.0348692403486925, + "eval_steps": 20, + "global_step": 1220, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.2056756391157555e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1240/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1240/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1240/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1240/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1240/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1240/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1240/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1240/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1240/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1240/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1240/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1240/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1240/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1240/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..aec7537030240eed6c20331d13391fab738fd742 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1240/trainer_state.json @@ -0,0 +1,1336 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 3.0846824408468243, + "eval_steps": 20, + "global_step": 1240, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.2245230478497997e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1260/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1260/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1260/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1260/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1260/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1260/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1260/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1260/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1260/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1260/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1260/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1260/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1260/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1260/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..0e4a9e65ddd7141054bceeed5b49dade599d2bdb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1260/trainer_state.json @@ -0,0 +1,1357 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 3.1344956413449565, + "eval_steps": 20, + "global_step": 1260, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.2456036384549888e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1280/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1280/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1280/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1280/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1280/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1280/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1280/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1280/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1280/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1280/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1280/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1280/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1280/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1280/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..63d194660b1f81844845f4d4ea8ddb8679158547 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1280/trainer_state.json @@ -0,0 +1,1378 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 3.1843088418430883, + "eval_steps": 20, + "global_step": 1280, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.26603168757291e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1300/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1300/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1300/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1300/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1300/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1300/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1300/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1300/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1300/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1300/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1300/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1300/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1300/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1300/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..5a8867bdc001082cf64129bfa6b0abc24528b0b7 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1300/trainer_state.json @@ -0,0 +1,1399 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 3.2341220423412205, + "eval_steps": 20, + "global_step": 1300, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.2852129964902605e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1320/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1320/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1320/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1320/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1320/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1320/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1320/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1320/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1320/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1320/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1320/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1320/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1320/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1320/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..2bbd5eb00ae283dad8d104a0bcfd6e8a8688d989 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1320/trainer_state.json @@ -0,0 +1,1420 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 3.2839352428393527, + "eval_steps": 20, + "global_step": 1320, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.3068070035063398e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1340/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1340/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1340/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1340/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1340/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1340/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1340/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1340/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1340/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1340/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1340/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1340/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1340/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1340/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..9d5600a352f4805edc32868811fa1026047cadf3 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1340/trainer_state.json @@ -0,0 +1,1441 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 3.3337484433374844, + "eval_steps": 20, + "global_step": 1340, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.3249722505755648e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1360/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1360/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1360/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1360/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1360/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1360/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1360/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1360/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1360/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1360/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1360/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1360/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1360/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1360/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..24b3460e6fdaaaa48012ab4783d7576f7591c515 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1360/trainer_state.json @@ -0,0 +1,1462 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 3.383561643835616, + "eval_steps": 20, + "global_step": 1360, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.3445125919480832e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1380/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1380/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1380/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1380/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1380/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1380/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1380/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1380/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1380/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1380/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1380/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1380/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1380/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1380/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..d4aae3db6d6d3767d6090d67b91f26c133804e54 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1380/trainer_state.json @@ -0,0 +1,1483 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 3.4333748443337484, + "eval_steps": 20, + "global_step": 1380, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.363284603866542e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-140/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-140/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-140/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-140/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-140/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-140/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-140/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-140/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-140/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-140/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-140/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-140/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-140/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-140/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..00104806855881c2ec3c2ddda8b5c7e4c9252d85 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-140/trainer_state.json @@ -0,0 +1,181 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 0.34869240348692404, + "eval_steps": 20, + "global_step": 140, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.3754802631827456e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1400/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1400/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1400/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1400/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1400/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1400/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1400/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1400/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1400/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1400/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1400/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1400/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1400/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1400/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..0dbc57c0b1e656d3a3fb257bc062c4cc4ec6df40 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1400/trainer_state.json @@ -0,0 +1,1504 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 3.4831880448318806, + "eval_steps": 20, + "global_step": 1400, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.385097620680274e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1420/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1420/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1420/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1420/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1420/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1420/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1420/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1420/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1420/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1420/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1420/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1420/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1420/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1420/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..91337e1cd619daa47e3d0280def4011f7b9b2f72 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1420/trainer_state.json @@ -0,0 +1,1525 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 3.5330012453300124, + "eval_steps": 20, + "global_step": 1420, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.405775197354537e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1440/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1440/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1440/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1440/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1440/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1440/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1440/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1440/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1440/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1440/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1440/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1440/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1440/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1440/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..f167215a10c9e913263cbf92252f420701084cee --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1440/trainer_state.json @@ -0,0 +1,1546 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 3.5828144458281446, + "eval_steps": 20, + "global_step": 1440, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.4260650189772186e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1460/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1460/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1460/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1460/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1460/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1460/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1460/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1460/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1460/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1460/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1460/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1460/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1460/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1460/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..70abf49a52c47bf637b67c73ed750c68fab508cc --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1460/trainer_state.json @@ -0,0 +1,1567 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 3.6326276463262763, + "eval_steps": 20, + "global_step": 1460, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.4456080530931507e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1480/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1480/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1480/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1480/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1480/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1480/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1480/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1480/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1480/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1480/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1480/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1480/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1480/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1480/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..21da5b2b10015a69367d980a1a4c57ed267533b8 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1480/trainer_state.json @@ -0,0 +1,1588 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 3.6824408468244085, + "eval_steps": 20, + "global_step": 1480, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.4642463254220595e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1500/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1500/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1500/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1500/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1500/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1500/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1500/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1500/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1500/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1500/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1500/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1500/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1500/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1500/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..8a91dedb8d575326148b8f962f7e6e2f5c50a270 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1500/trainer_state.json @@ -0,0 +1,1609 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 3.7322540473225407, + "eval_steps": 20, + "global_step": 1500, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.4841169766533325e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1520/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1520/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1520/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1520/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1520/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1520/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1520/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1520/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1520/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1520/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1520/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1520/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1520/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1520/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..4a926984fa869df7e00d8aba8cccc3a031640fae --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1520/trainer_state.json @@ -0,0 +1,1630 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 3.7820672478206725, + "eval_steps": 20, + "global_step": 1520, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.5019420404712858e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1540/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1540/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1540/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1540/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1540/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1540/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1540/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1540/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1540/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1540/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1540/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1540/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1540/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1540/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..5d1c3f01f4598d1ad6cb2277961cd1fd75d0093f --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1540/trainer_state.json @@ -0,0 +1,1651 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 3.8318804483188043, + "eval_steps": 20, + "global_step": 1540, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.5214482737605632e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1560/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1560/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1560/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1560/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1560/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1560/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1560/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1560/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1560/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1560/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1560/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1560/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1560/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1560/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..2afa0a884859ed868bec7faba2e0a37236638669 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1560/trainer_state.json @@ -0,0 +1,1672 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 3.8816936488169365, + "eval_steps": 20, + "global_step": 1560, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.541802721225175e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1580/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1580/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1580/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1580/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1580/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1580/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1580/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1580/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1580/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1580/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1580/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1580/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1580/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1580/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..17d4fb82022c168b921d22b7f2f50b18f8beceba --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1580/trainer_state.json @@ -0,0 +1,1693 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 3.9315068493150687, + "eval_steps": 20, + "global_step": 1580, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.559732802036265e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-160/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-160/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-160/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-160/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-160/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-160/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-160/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-160/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-160/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-160/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-160/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-160/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-160/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-160/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..9f51eff8583228db5644e4fee421cc409ded8fb3 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-160/trainer_state.json @@ -0,0 +1,202 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 0.398505603985056, + "eval_steps": 20, + "global_step": 160, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.5751830905585664e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1600/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1600/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1600/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1600/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1600/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1600/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1600/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1600/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1600/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1600/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1600/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1600/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1600/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1600/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..6c2b2227185da1b5072ed938eaaa9d6750146871 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1600/trainer_state.json @@ -0,0 +1,1714 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 3.9813200498132004, + "eval_steps": 20, + "global_step": 1600, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.5786448366122394e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1620/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1620/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1620/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1620/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1620/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1620/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1620/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1620/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1620/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1620/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1620/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1620/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1620/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1620/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..05fca03dc0e75e1bd3d161e2d40d2d62b135789e --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1620/trainer_state.json @@ -0,0 +1,1735 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 4.029887920298879, + "eval_steps": 20, + "global_step": 1620, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.5984833993178317e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1640/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1640/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1640/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1640/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1640/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1640/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1640/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1640/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1640/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1640/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1640/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1640/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1640/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1640/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..50fdc814b097d602100d4d4f86f018b8bd256ae6 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1640/trainer_state.json @@ -0,0 +1,1756 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 4.0797011207970115, + "eval_steps": 20, + "global_step": 1640, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.6179941205127987e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1660/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1660/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1660/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1660/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1660/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1660/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1660/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1660/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1660/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1660/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1660/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1660/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1660/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1660/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..1907262b85ce5386b1de634b9df85698f044660e --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1660/trainer_state.json @@ -0,0 +1,1777 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 4.129514321295143, + "eval_steps": 20, + "global_step": 1660, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.6397263550241178e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1680/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1680/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1680/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1680/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1680/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1680/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1680/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1680/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1680/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1680/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1680/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1680/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1680/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1680/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..d919d58536c3b515e173dc864e76744b4e1d3a2c --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1680/trainer_state.json @@ -0,0 +1,1798 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 4.179327521793275, + "eval_steps": 20, + "global_step": 1680, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.659570078821253e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1700/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1700/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1700/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1700/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1700/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1700/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1700/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1700/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1700/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1700/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1700/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1700/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1700/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1700/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..dc1d7781bbcff7d9e2166e6c1a1e45fd514e2597 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1700/trainer_state.json @@ -0,0 +1,1819 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 4.229140722291407, + "eval_steps": 20, + "global_step": 1700, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.67823079067861e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1720/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1720/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1720/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1720/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1720/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1720/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1720/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1720/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1720/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1720/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1720/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1720/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1720/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1720/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..ca850995f6bdb5f6032d08745a0f118e386bc043 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1720/trainer_state.json @@ -0,0 +1,1840 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 4.2789539227895395, + "eval_steps": 20, + "global_step": 1720, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.6969022735096218e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1740/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1740/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1740/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1740/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1740/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1740/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1740/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1740/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1740/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1740/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1740/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1740/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1740/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1740/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..b48dd1820a14b1fb6df848ac327194c1d69e5e1c --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1740/trainer_state.json @@ -0,0 +1,1861 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 4.328767123287671, + "eval_steps": 20, + "global_step": 1740, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.7173159613293363e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1760/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1760/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1760/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1760/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1760/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1760/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1760/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1760/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1760/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1760/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1760/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1760/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1760/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1760/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..0bbf014cafc49db662e46901feee5a2b2c74017d --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1760/trainer_state.json @@ -0,0 +1,1882 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 4.378580323785803, + "eval_steps": 20, + "global_step": 1760, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.7368688688377856e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1780/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1780/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1780/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1780/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1780/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1780/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1780/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1780/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1780/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1780/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1780/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1780/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1780/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1780/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..7befad6c9ef53e98e60eda24e6c2fbbf36adb411 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1780/trainer_state.json @@ -0,0 +1,1903 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 4.428393524283935, + "eval_steps": 20, + "global_step": 1780, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.756396644074373e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-180/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-180/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-180/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-180/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-180/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-180/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-180/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-180/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-180/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-180/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-180/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-180/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-180/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-180/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..1a850eac6dc5393e98ab6b17ddcb0846152a45f5 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-180/trainer_state.json @@ -0,0 +1,223 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 0.44831880448318806, + "eval_steps": 20, + "global_step": 180, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.7813036230705152e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1800/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1800/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1800/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1800/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1800/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1800/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1800/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1800/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1800/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1800/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1800/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1800/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1800/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1800/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..640abe3427039b775c214983af5c2871db966c17 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1800/trainer_state.json @@ -0,0 +1,1924 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 4.478206724782067, + "eval_steps": 20, + "global_step": 1800, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.7752727754048307e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1820/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1820/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1820/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1820/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1820/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1820/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1820/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1820/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1820/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1820/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1820/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1820/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1820/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1820/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..ac72acebba6fa533c2a50c885055bd74c7d21f2e --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1820/trainer_state.json @@ -0,0 +1,1945 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 4.5280199252802, + "eval_steps": 20, + "global_step": 1820, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.7933742942132634e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1840/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1840/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1840/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1840/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1840/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1840/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1840/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1840/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1840/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1840/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1840/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1840/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1840/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1840/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..efced28cc370833c69672a34874e350d19510466 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1840/trainer_state.json @@ -0,0 +1,1966 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 4.577833125778331, + "eval_steps": 20, + "global_step": 1840, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.8121184811164467e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1860/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1860/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1860/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1860/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1860/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1860/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1860/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1860/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1860/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1860/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1860/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1860/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1860/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1860/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..f0d138ae627cba49a4d02b3e8afbd53148b48d53 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1860/trainer_state.json @@ -0,0 +1,1987 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 4.627646326276463, + "eval_steps": 20, + "global_step": 1860, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.83182936290517e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1880/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1880/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1880/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1880/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1880/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1880/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1880/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1880/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1880/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1880/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1880/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1880/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1880/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1880/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..7c62e30cbade6f04a7f30343b86f2fa7f1d51dc9 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1880/trainer_state.json @@ -0,0 +1,2008 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 4.677459526774595, + "eval_steps": 20, + "global_step": 1880, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.85193428281344e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1900/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1900/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1900/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1900/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1900/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1900/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1900/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1900/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1900/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1900/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1900/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1900/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1900/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1900/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..61871064ac4543fa53e0a481622ca2212080f0d3 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1900/trainer_state.json @@ -0,0 +1,2029 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 4.7272727272727275, + "eval_steps": 20, + "global_step": 1900, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.87351931401814e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1920/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1920/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1920/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1920/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1920/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1920/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1920/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1920/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1920/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1920/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1920/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1920/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1920/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1920/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..4de2866a0813dcb525d96866fbfa9e1a0b6dda48 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1920/trainer_state.json @@ -0,0 +1,2050 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 4.777085927770859, + "eval_steps": 20, + "global_step": 1920, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.894537073943675e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1940/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1940/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1940/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1940/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1940/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1940/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1940/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1940/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1940/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1940/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1940/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1940/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1940/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1940/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..c471080274e2f83f0f4c13e816a6fa87e093323b --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1940/trainer_state.json @@ -0,0 +1,2071 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 4.826899128268991, + "eval_steps": 20, + "global_step": 1940, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.913542456957993e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1960/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1960/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1960/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1960/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1960/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1960/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1960/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1960/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1960/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1960/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1960/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1960/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1960/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1960/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..72792742464fb5f9c47c9546b381a170eb274a78 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1960/trainer_state.json @@ -0,0 +1,2092 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 4.876712328767123, + "eval_steps": 20, + "global_step": 1960, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.9335782631186432e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1980/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1980/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1980/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1980/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1980/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1980/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1980/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1980/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1980/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1980/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1980/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1980/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1980/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1980/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..ac7e78a1dcbe093d32c86a5e1a75859fff555268 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1980/trainer_state.json @@ -0,0 +1,2113 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 4.926525529265255, + "eval_steps": 20, + "global_step": 1980, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.9516824746704896e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-20/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-20/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-20/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-20/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-20/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-20/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3440/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3440/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3440/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3440/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3440/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3440/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3440/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3440/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3440/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3460/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3460/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3460/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3460/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3460/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3460/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3460/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3460/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3460/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3460/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3460/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3460/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3460/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3460/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..91e972f4341a24861abe46be31f13ed17be9832b --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3460/trainer_state.json @@ -0,0 +1,3667 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 8.607721046077211, + "eval_steps": 20, + "global_step": 3460, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + }, + { + "entropy": 0.561330484598875, + "epoch": 1.891656288916563, + "grad_norm": 0.6722865700721741, + "learning_rate": 0.0002208867897174789, + "loss": 0.499837589263916, + "mean_token_accuracy": 0.8518734864890576, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.5865232653396074, + "eval_loss": 0.5437926650047302, + "eval_mean_token_accuracy": 0.8450997017843779, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4116, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.547389242425561, + "epoch": 1.9414694894146949, + "grad_norm": 0.7935577034950256, + "learning_rate": 0.00022027119820226907, + "loss": 0.4977591514587402, + "mean_token_accuracy": 0.8539491161704064, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.5290903090391048, + "eval_loss": 0.5409526824951172, + "eval_mean_token_accuracy": 0.8497545698354411, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.7262, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 780 + }, + { + "entropy": 0.5687909748405218, + "epoch": 1.9912826899128269, + "grad_norm": 0.6180546283721924, + "learning_rate": 0.00021962329729698345, + "loss": 0.5109643459320068, + "mean_token_accuracy": 0.8521598495543004, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.5503541858390321, + "eval_loss": 0.5361555218696594, + "eval_mean_token_accuracy": 0.8510884285666221, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.3339, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 800 + }, + { + "entropy": 0.4739728841261986, + "epoch": 2.0398505603985058, + "grad_norm": 0.8058829307556152, + "learning_rate": 0.0002189432823996982, + "loss": 0.4204097747802734, + "mean_token_accuracy": 0.8728981889211215, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.5077334992414297, + "eval_loss": 0.5531114339828491, + "eval_mean_token_accuracy": 0.8489257208136625, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.4801, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.989, + "step": 820 + }, + { + "entropy": 0.4594309840351343, + "epoch": 2.0896637608966375, + "grad_norm": 0.6906896829605103, + "learning_rate": 0.0002182313585936314, + "loss": 0.4071959495544434, + "mean_token_accuracy": 0.8732857562601566, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.49850136994622474, + "eval_loss": 0.5486204624176025, + "eval_mean_token_accuracy": 0.8507991450470548, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.3364, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.4881629109382629, + "epoch": 2.1394769613947697, + "grad_norm": 0.6343470215797424, + "learning_rate": 0.0002174877405852928, + "loss": 0.41669540405273436, + "mean_token_accuracy": 0.8711295068264008, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.49155513924914734, + "eval_loss": 0.555109441280365, + "eval_mean_token_accuracy": 0.8496399400539176, + "eval_num_tokens": 2008562.0, + "eval_runtime": 86.3295, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 860 + }, + { + "entropy": 0.4648668970912695, + "epoch": 2.1892901618929015, + "grad_norm": 0.8014165163040161, + "learning_rate": 0.00021671265263973133, + "loss": 0.4110250473022461, + "mean_token_accuracy": 0.8754166305065155, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.4909258722219356, + "eval_loss": 0.5539511442184448, + "eval_mean_token_accuracy": 0.8492401502160138, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.3468, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 880 + }, + { + "entropy": 0.4824485514312983, + "epoch": 2.2391033623910337, + "grad_norm": 0.6665191054344177, + "learning_rate": 0.00021590632851289967, + "loss": 0.4181404113769531, + "mean_token_accuracy": 0.8726993151009083, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.4986876940657926, + "eval_loss": 0.547695517539978, + "eval_mean_token_accuracy": 0.8501384708770486, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.3838, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 900 + }, + { + "entropy": 0.4751896943897009, + "epoch": 2.2889165628891655, + "grad_norm": 0.81158047914505, + "learning_rate": 0.00021506901138115678, + "loss": 0.40689678192138673, + "mean_token_accuracy": 0.8745221219956875, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.507153491121392, + "eval_loss": 0.5501641631126404, + "eval_mean_token_accuracy": 0.8495670116918032, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.0912, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 920 + }, + { + "entropy": 0.4873133715242147, + "epoch": 2.3387297633872977, + "grad_norm": 0.7218056321144104, + "learning_rate": 0.0002142009537679292, + "loss": 0.42701358795166017, + "mean_token_accuracy": 0.8695114746689796, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5202612736543943, + "eval_loss": 0.5491839051246643, + "eval_mean_token_accuracy": 0.8494071208460386, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.1142, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 940 + }, + { + "entropy": 0.4762951169162989, + "epoch": 2.3885429638854294, + "grad_norm": 0.7194424867630005, + "learning_rate": 0.0002133024174675534, + "loss": 0.42299847602844237, + "mean_token_accuracy": 0.8709790132939815, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4899340462546016, + "eval_loss": 0.5522511601448059, + "eval_mean_token_accuracy": 0.8492208258357159, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.463, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 960 + }, + { + "entropy": 0.49650347977876663, + "epoch": 2.4383561643835616, + "grad_norm": 0.8406022787094116, + "learning_rate": 0.0002123736734663221, + "loss": 0.4275330066680908, + "mean_token_accuracy": 0.8670595556497573, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.49691385654515996, + "eval_loss": 0.5491269826889038, + "eval_mean_token_accuracy": 0.850309816210769, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.17, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 980 + }, + { + "entropy": 0.48843890577554705, + "epoch": 2.488169364881694, + "grad_norm": 0.9082473516464233, + "learning_rate": 0.00021141500186075868, + "loss": 0.4309722423553467, + "mean_token_accuracy": 0.8686766296625137, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5543508351195691, + "eval_loss": 0.5478800535202026, + "eval_mean_token_accuracy": 0.8478029522784921, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.3835, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 1000 + }, + { + "entropy": 0.4777219031006098, + "epoch": 2.5379825653798256, + "grad_norm": 0.7448089122772217, + "learning_rate": 0.0002104266917731438, + "loss": 0.423325252532959, + "mean_token_accuracy": 0.8706337086856365, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.49857561550168106, + "eval_loss": 0.5511948466300964, + "eval_mean_token_accuracy": 0.8502220289651737, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.5399, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.988, + "step": 1020 + }, + { + "entropy": 0.4844174191355705, + "epoch": 2.587795765877958, + "grad_norm": 0.794029176235199, + "learning_rate": 0.00020940904126432, + "loss": 0.4176753044128418, + "mean_token_accuracy": 0.873535567522049, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.485467542222766, + "eval_loss": 0.5539286732673645, + "eval_mean_token_accuracy": 0.8495475081510322, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.135, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 1.997, + "step": 1040 + }, + { + "entropy": 0.49070929251611234, + "epoch": 2.6376089663760895, + "grad_norm": 0.7558256983757019, + "learning_rate": 0.0002083623572438007, + "loss": 0.42867293357849123, + "mean_token_accuracy": 0.8696666076779366, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.490822730889154, + "eval_loss": 0.5434785485267639, + "eval_mean_token_accuracy": 0.850568296950917, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.4933, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 1060 + }, + { + "entropy": 0.47806114703416824, + "epoch": 2.6874221668742218, + "grad_norm": 0.6608979105949402, + "learning_rate": 0.00020728695537721047, + "loss": 0.4289727687835693, + "mean_token_accuracy": 0.8693130135536193, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.5285773256490397, + "eval_loss": 0.5444230437278748, + "eval_mean_token_accuracy": 0.8498796481032704, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.7091, + "eval_samples_per_second": 15.858, + "eval_steps_per_second": 1.984, + "step": 1080 + }, + { + "entropy": 0.5046216730028391, + "epoch": 2.7372353673723535, + "grad_norm": 0.8428544998168945, + "learning_rate": 0.00020618315999108454, + "loss": 0.43131070137023925, + "mean_token_accuracy": 0.8701941035687923, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.49888394738352576, + "eval_loss": 0.5459766387939453, + "eval_mean_token_accuracy": 0.8511758872935938, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.2222, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.995, + "step": 1100 + }, + { + "entropy": 0.5212558470666409, + "epoch": 2.7870485678704857, + "grad_norm": 1.129318118095398, + "learning_rate": 0.00020505130397505635, + "loss": 0.44249300956726073, + "mean_token_accuracy": 0.8654101334512234, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5179622324053631, + "eval_loss": 0.5522801280021667, + "eval_mean_token_accuracy": 0.8497019947268242, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.1903, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.996, + "step": 1120 + }, + { + "entropy": 0.4988406613469124, + "epoch": 2.8368617683686175, + "grad_norm": 0.6460545063018799, + "learning_rate": 0.00020389172868146263, + "loss": 0.4386270523071289, + "mean_token_accuracy": 0.8690383620560169, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.5042278484203094, + "eval_loss": 0.5433034300804138, + "eval_mean_token_accuracy": 0.8497674451317898, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.3028, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.993, + "step": 1140 + }, + { + "entropy": 0.4926559619605541, + "epoch": 2.8866749688667497, + "grad_norm": 0.8199329972267151, + "learning_rate": 0.00020270478382239615, + "loss": 0.4313485145568848, + "mean_token_accuracy": 0.8674727231264114, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.503873193160046, + "eval_loss": 0.5388111472129822, + "eval_mean_token_accuracy": 0.8526195034731266, + "eval_num_tokens": 2710196.0, + "eval_runtime": 86.4054, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.991, + "step": 1160 + }, + { + "entropy": 0.5020013231784105, + "epoch": 2.936488169364882, + "grad_norm": 0.7344821095466614, + "learning_rate": 0.00020149082736423723, + "loss": 0.43590536117553713, + "mean_token_accuracy": 0.8671772189438343, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5368241809828337, + "eval_loss": 0.5355703830718994, + "eval_mean_token_accuracy": 0.8517617773871089, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.2945, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1180 + }, + { + "entropy": 0.5112275708466768, + "epoch": 2.9863013698630136, + "grad_norm": 0.6951606869697571, + "learning_rate": 0.00020025022541969622, + "loss": 0.43579301834106443, + "mean_token_accuracy": 0.8641206480562686, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.5066795706055885, + "eval_loss": 0.5415249466896057, + "eval_mean_token_accuracy": 0.8493563373421513, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.5005, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.988, + "step": 1200 + }, + { + "entropy": 0.42298635305502474, + "epoch": 3.0348692403486925, + "grad_norm": 0.8201794028282166, + "learning_rate": 0.00019898335213739863, + "loss": 0.35593905448913576, + "mean_token_accuracy": 0.889238600547497, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.4584170470750609, + "eval_loss": 0.569487452507019, + "eval_mean_token_accuracy": 0.8495814173027526, + "eval_num_tokens": 2848509.0, + "eval_runtime": 86.2281, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 1220 + }, + { + "entropy": 0.37450140453875064, + "epoch": 3.0846824408468243, + "grad_norm": 0.7308394908905029, + "learning_rate": 0.0001976905895890471, + "loss": 0.307823920249939, + "mean_token_accuracy": 0.9001288741827012, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.45185995916294497, + "eval_loss": 0.5672881603240967, + "eval_mean_token_accuracy": 0.8511318519364955, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.0819, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.998, + "step": 1240 + }, + { + "entropy": 0.3887945845723152, + "epoch": 3.1344956413449565, + "grad_norm": 0.7299330830574036, + "learning_rate": 0.0001963723276541939, + "loss": 0.32047903537750244, + "mean_token_accuracy": 0.8960984498262405, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.44865354549053105, + "eval_loss": 0.5666037201881409, + "eval_mean_token_accuracy": 0.8496572649063066, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 1260 + }, + { + "entropy": 0.39677664265036583, + "epoch": 3.1843088418430883, + "grad_norm": 0.9533219933509827, + "learning_rate": 0.00019502896390265838, + "loss": 0.3253983497619629, + "mean_token_accuracy": 0.8964207418262958, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.4641980809527774, + "eval_loss": 0.5814996957778931, + "eval_mean_token_accuracy": 0.8485886212005171, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.7784, + "eval_samples_per_second": 15.845, + "eval_steps_per_second": 1.982, + "step": 1280 + }, + { + "entropy": 0.39210722744464876, + "epoch": 3.2341220423412205, + "grad_norm": 0.7447651028633118, + "learning_rate": 0.00019366090347462545, + "loss": 0.3276803970336914, + "mean_token_accuracy": 0.8930055953562259, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43595615254585135, + "eval_loss": 0.5722188353538513, + "eval_mean_token_accuracy": 0.8501105755567551, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.5271, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 1300 + }, + { + "entropy": 0.3684127271175385, + "epoch": 3.2839352428393527, + "grad_norm": 0.6934201121330261, + "learning_rate": 0.00019226855895846078, + "loss": 0.3156379222869873, + "mean_token_accuracy": 0.8976306475698947, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.4628148723480313, + "eval_loss": 0.5631352066993713, + "eval_mean_token_accuracy": 0.8504934813394103, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.3436, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 1320 + }, + { + "entropy": 0.4073401909321547, + "epoch": 3.3337484433374844, + "grad_norm": 0.9386897683143616, + "learning_rate": 0.00019085235026627994, + "loss": 0.34265310764312745, + "mean_token_accuracy": 0.8902062118053437, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.46455050623694133, + "eval_loss": 0.5586736798286438, + "eval_mean_token_accuracy": 0.8506874702004499, + "eval_num_tokens": 3132874.0, + "eval_runtime": 86.1286, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.997, + "step": 1340 + }, + { + "entropy": 0.4046429242938757, + "epoch": 3.383561643835616, + "grad_norm": 0.9633992314338684, + "learning_rate": 0.00018941270450730836, + "loss": 0.33816893100738527, + "mean_token_accuracy": 0.8927541889250279, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.46846531660750856, + "eval_loss": 0.561501681804657, + "eval_mean_token_accuracy": 0.8496256377114806, + "eval_num_tokens": 3178055.0, + "eval_runtime": 86.685, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1360 + }, + { + "entropy": 0.39872407019138334, + "epoch": 3.4333748443337484, + "grad_norm": 0.7786458730697632, + "learning_rate": 0.00018795005585907113, + "loss": 0.33342490196228025, + "mean_token_accuracy": 0.8944805048406124, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.42709505973860273, + "eval_loss": 0.5751848220825195, + "eval_mean_token_accuracy": 0.8507290447867194, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.6892, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 1380 + }, + { + "entropy": 0.3923338124528527, + "epoch": 3.4831880448318806, + "grad_norm": 0.9305956363677979, + "learning_rate": 0.0001864648454364511, + "loss": 0.33188116550445557, + "mean_token_accuracy": 0.8943330392241478, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.4386174779298694, + "eval_loss": 0.5680831074714661, + "eval_mean_token_accuracy": 0.8513129727784977, + "eval_num_tokens": 3274096.0, + "eval_runtime": 86.2671, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 1400 + }, + { + "entropy": 0.3856233984231949, + "epoch": 3.5330012453300124, + "grad_norm": 1.0362752676010132, + "learning_rate": 0.0001849575211586545, + "loss": 0.33098697662353516, + "mean_token_accuracy": 0.8961390435695649, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4574795474493226, + "eval_loss": 0.5630439519882202, + "eval_mean_token_accuracy": 0.8520988873964133, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.6035, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 1420 + }, + { + "entropy": 0.39812871962785723, + "epoch": 3.5828144458281446, + "grad_norm": 0.7807195782661438, + "learning_rate": 0.0001834285376141247, + "loss": 0.3333771228790283, + "mean_token_accuracy": 0.8930827379226685, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.4556825893909432, + "eval_loss": 0.5689062476158142, + "eval_mean_token_accuracy": 0.8507103507601937, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.1606, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.996, + "step": 1440 + }, + { + "entropy": 0.4147744856774807, + "epoch": 3.6326276463262763, + "grad_norm": 0.6429352164268494, + "learning_rate": 0.00018187835592344443, + "loss": 0.3482560873031616, + "mean_token_accuracy": 0.8910200245678425, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.46600024540757023, + "eval_loss": 0.5609709024429321, + "eval_mean_token_accuracy": 0.8491220876227977, + "eval_num_tokens": 3415600.0, + "eval_runtime": 86.8039, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1460 + }, + { + "entropy": 0.40425071083009245, + "epoch": 3.6824408468244085, + "grad_norm": 0.8613698482513428, + "learning_rate": 0.0001803074436002682, + "loss": 0.342916464805603, + "mean_token_accuracy": 0.8916418336331844, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.43855057899342026, + "eval_loss": 0.5720968246459961, + "eval_mean_token_accuracy": 0.8500823641932288, + "eval_num_tokens": 3460471.0, + "eval_runtime": 86.6746, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1480 + }, + { + "entropy": 0.39465143866837027, + "epoch": 3.7322540473225407, + "grad_norm": 0.6285189986228943, + "learning_rate": 0.0001787162744103265, + "loss": 0.3424591779708862, + "mean_token_accuracy": 0.8906558901071548, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4509461877304454, + "eval_loss": 0.5590082406997681, + "eval_mean_token_accuracy": 0.8511747371318729, + "eval_num_tokens": 3507647.0, + "eval_runtime": 86.8126, + "eval_samples_per_second": 15.839, + "eval_steps_per_second": 1.981, + "step": 1500 + }, + { + "entropy": 0.4021005939692259, + "epoch": 3.7820672478206725, + "grad_norm": 0.8821248412132263, + "learning_rate": 0.00017710532822854468, + "loss": 0.3462103843688965, + "mean_token_accuracy": 0.889109355956316, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.4502199075596277, + "eval_loss": 0.566046416759491, + "eval_mean_token_accuracy": 0.8501714208098345, + "eval_num_tokens": 3548934.0, + "eval_runtime": 86.8336, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.981, + "step": 1520 + }, + { + "entropy": 0.4017397932708263, + "epoch": 3.8318804483188043, + "grad_norm": 0.8400952816009521, + "learning_rate": 0.0001754750908943189, + "loss": 0.34890995025634763, + "mean_token_accuracy": 0.8892098367214203, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.4614003023435903, + "eval_loss": 0.5617933869361877, + "eval_mean_token_accuracy": 0.8515863616106122, + "eval_num_tokens": 3597186.0, + "eval_runtime": 86.4609, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 1540 + }, + { + "entropy": 0.4112051840871572, + "epoch": 3.8816936488169365, + "grad_norm": 0.769478440284729, + "learning_rate": 0.0001738260540649939, + "loss": 0.34711437225341796, + "mean_token_accuracy": 0.8911717928946018, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4540443811998811, + "eval_loss": 0.5576469898223877, + "eval_mean_token_accuracy": 0.8512079674144124, + "eval_num_tokens": 3646646.0, + "eval_runtime": 86.5103, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 1560 + }, + { + "entropy": 0.41105241514742374, + "epoch": 3.9315068493150687, + "grad_norm": 0.8468427062034607, + "learning_rate": 0.00017215871506758568, + "loss": 0.3433023452758789, + "mean_token_accuracy": 0.8898739732801915, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.4707539707075718, + "eval_loss": 0.5641466379165649, + "eval_mean_token_accuracy": 0.8495440957851188, + "eval_num_tokens": 3689560.0, + "eval_runtime": 86.609, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.986, + "step": 1580 + }, + { + "entropy": 0.41016379147768023, + "epoch": 3.9813200498132004, + "grad_norm": 0.7482675313949585, + "learning_rate": 0.0001704735767487946, + "loss": 0.34550890922546384, + "mean_token_accuracy": 0.8893028847873211, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.46391099864660307, + "eval_loss": 0.5593640804290771, + "eval_mean_token_accuracy": 0.8510130581467651, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.3975, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 1600 + }, + { + "entropy": 0.33167599791135544, + "epoch": 4.029887920298879, + "grad_norm": 0.9435692429542542, + "learning_rate": 0.00016877114732335337, + "loss": 0.2716026544570923, + "mean_token_accuracy": 0.9133149828666296, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.38499350005457567, + "eval_loss": 0.6298249363899231, + "eval_mean_token_accuracy": 0.8488117071778275, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.2933, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1620 + }, + { + "entropy": 0.3000166634097695, + "epoch": 4.0797011207970115, + "grad_norm": 0.8080845475196838, + "learning_rate": 0.0001670519402207569, + "loss": 0.22617182731628419, + "mean_token_accuracy": 0.9253474645316601, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.370110988703578, + "eval_loss": 0.6338461637496948, + "eval_mean_token_accuracy": 0.8485634801692741, + "eval_num_tokens": 3828830.0, + "eval_runtime": 85.9508, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.001, + "step": 1640 + }, + { + "entropy": 0.2986910421401262, + "epoch": 4.129514321295143, + "grad_norm": 0.7310900092124939, + "learning_rate": 0.0001653164739304185, + "loss": 0.22367463111877442, + "mean_token_accuracy": 0.9252275295555592, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.3944379702037157, + "eval_loss": 0.6109381914138794, + "eval_mean_token_accuracy": 0.849291454220927, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.6728, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1660 + }, + { + "entropy": 0.3095553796738386, + "epoch": 4.179327521793275, + "grad_norm": 0.7059140801429749, + "learning_rate": 0.0001635652718453007, + "loss": 0.23651680946350098, + "mean_token_accuracy": 0.9208931416273117, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.3910588648949945, + "eval_loss": 0.6104469299316406, + "eval_mean_token_accuracy": 0.8486883893262508, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7612, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.982, + "step": 1680 + }, + { + "entropy": 0.3001101028174162, + "epoch": 4.229140722291407, + "grad_norm": 0.6787802577018738, + "learning_rate": 0.00016179886210406728, + "loss": 0.23130471706390382, + "mean_token_accuracy": 0.9233332790434361, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3794369170832079, + "eval_loss": 0.6182110905647278, + "eval_mean_token_accuracy": 0.8495433777570724, + "eval_num_tokens": 3967474.0, + "eval_runtime": 85.94, + "eval_samples_per_second": 16.0, + "eval_steps_per_second": 2.001, + "step": 1700 + }, + { + "entropy": 0.3031421799212694, + "epoch": 4.2789539227895395, + "grad_norm": 0.9732038378715515, + "learning_rate": 0.0001600177774318036, + "loss": 0.2359529733657837, + "mean_token_accuracy": 0.9217648565769195, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3923123094231583, + "eval_loss": 0.6057384610176086, + "eval_mean_token_accuracy": 0.8508818288182103, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7647, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.29365369994193313, + "epoch": 4.328767123287671, + "grad_norm": 0.7681498527526855, + "learning_rate": 0.0001582225549793541, + "loss": 0.2269371747970581, + "mean_token_accuracy": 0.9245341829955578, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.4011661055129628, + "eval_loss": 0.6144486665725708, + "eval_mean_token_accuracy": 0.8480324357054955, + "eval_num_tokens": 4062594.0, + "eval_runtime": 87.1306, + "eval_samples_per_second": 15.781, + "eval_steps_per_second": 1.974, + "step": 1740 + }, + { + "entropy": 0.29396994728595016, + "epoch": 4.378580323785803, + "grad_norm": 1.0001007318496704, + "learning_rate": 0.0001564137361613248, + "loss": 0.22777395248413085, + "mean_token_accuracy": 0.9262309700250626, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38518730195802314, + "eval_loss": 0.6202630400657654, + "eval_mean_token_accuracy": 0.8493869807137999, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6616, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.3096018506214023, + "epoch": 4.428393524283935, + "grad_norm": 1.0448365211486816, + "learning_rate": 0.00015459186649280024, + "loss": 0.23696351051330566, + "mean_token_accuracy": 0.9217322513461113, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.3946371126140273, + "eval_loss": 0.6079026460647583, + "eval_mean_token_accuracy": 0.8492515852978063, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6582, + "eval_samples_per_second": 15.867, + "eval_steps_per_second": 1.985, + "step": 1780 + }, + { + "entropy": 0.32619857545942066, + "epoch": 4.478206724782067, + "grad_norm": 0.7210651636123657, + "learning_rate": 0.00015275749542482337, + "loss": 0.24651215076446534, + "mean_token_accuracy": 0.9177676141262054, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.3947690814560236, + "eval_loss": 0.6065912246704102, + "eval_mean_token_accuracy": 0.8502957744653835, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.5959, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.986, + "step": 1800 + }, + { + "entropy": 0.3193941755220294, + "epoch": 4.5280199252802, + "grad_norm": 0.8281906843185425, + "learning_rate": 0.0001509111761786888, + "loss": 0.23936262130737304, + "mean_token_accuracy": 0.9201708927750587, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38704028864239537, + "eval_loss": 0.6006569266319275, + "eval_mean_token_accuracy": 0.8502406720505205, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.8059, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1820 + }, + { + "entropy": 0.3164879363030195, + "epoch": 4.577833125778331, + "grad_norm": 0.7892968654632568, + "learning_rate": 0.00014905346557909867, + "loss": 0.24541733264923096, + "mean_token_accuracy": 0.9175932116806507, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.38861122120951497, + "eval_loss": 0.6115967631340027, + "eval_mean_token_accuracy": 0.849471275196519, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.2946, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1840 + }, + { + "entropy": 0.3051785985007882, + "epoch": 4.627646326276463, + "grad_norm": 0.8109654188156128, + "learning_rate": 0.0001471849238862319, + "loss": 0.23433220386505127, + "mean_token_accuracy": 0.9206570319831371, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.37162452295076015, + "eval_loss": 0.6184061765670776, + "eval_mean_token_accuracy": 0.8501173268223918, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.6865, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1860 + }, + { + "entropy": 0.3168198253959417, + "epoch": 4.677459526774595, + "grad_norm": 0.9512342214584351, + "learning_rate": 0.0001453061146267775, + "loss": 0.23832404613494873, + "mean_token_accuracy": 0.9197044663131237, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3845940856912801, + "eval_loss": 0.606762707233429, + "eval_mean_token_accuracy": 0.8504838194957999, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.5175, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 1880 + }, + { + "entropy": 0.30791807882487776, + "epoch": 4.7272727272727275, + "grad_norm": 0.8123113512992859, + "learning_rate": 0.00014341760442398248, + "loss": 0.2395785331726074, + "mean_token_accuracy": 0.918928150832653, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.39762327222283494, + "eval_loss": 0.5994202494621277, + "eval_mean_token_accuracy": 0.8509274201337681, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.2873, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.993, + "step": 1900 + }, + { + "entropy": 0.3021434534341097, + "epoch": 4.777085927770859, + "grad_norm": 0.731787383556366, + "learning_rate": 0.000141519962826766, + "loss": 0.23494718074798585, + "mean_token_accuracy": 0.9201403826475143, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.3827026732439219, + "eval_loss": 0.5995895862579346, + "eval_mean_token_accuracy": 0.851468373523202, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.3006, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 1920 + }, + { + "entropy": 0.31626159623265265, + "epoch": 4.826899128268991, + "grad_norm": 0.8848487138748169, + "learning_rate": 0.00013961376213795132, + "loss": 0.2439030647277832, + "mean_token_accuracy": 0.9196575872600079, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.388698436839636, + "eval_loss": 0.6000174283981323, + "eval_mean_token_accuracy": 0.8518068187458571, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.8979, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.979, + "step": 1940 + }, + { + "entropy": 0.30520407035946845, + "epoch": 4.876712328767123, + "grad_norm": 0.8532460927963257, + "learning_rate": 0.00013769957724166695, + "loss": 0.23458616733551024, + "mean_token_accuracy": 0.9221912942826748, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.38777847102908203, + "eval_loss": 0.6004981398582458, + "eval_mean_token_accuracy": 0.8516481768253238, + "eval_num_tokens": 4578167.0, + "eval_runtime": 87.0777, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.975, + "step": 1960 + }, + { + "entropy": 0.3226448342204094, + "epoch": 4.926525529265255, + "grad_norm": 0.6945561766624451, + "learning_rate": 0.0001357779854299694, + "loss": 0.24048397541046143, + "mean_token_accuracy": 0.9195300146937371, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.38581624263247777, + "eval_loss": 0.6029234528541565, + "eval_mean_token_accuracy": 0.8514213260523108, + "eval_num_tokens": 4622316.0, + "eval_runtime": 85.8729, + "eval_samples_per_second": 16.012, + "eval_steps_per_second": 2.003, + "step": 1980 + }, + { + "entropy": 0.3051655298098922, + "epoch": 4.976338729763388, + "grad_norm": 0.7976452708244324, + "learning_rate": 0.00013384956622874001, + "loss": 0.23584742546081544, + "mean_token_accuracy": 0.9216851457953453, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.37913159246361533, + "eval_loss": 0.6057604551315308, + "eval_mean_token_accuracy": 0.8525801203971686, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.1145, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 2000 + }, + { + "entropy": 0.27438195240803254, + "epoch": 5.024906600249066, + "grad_norm": 0.6729586124420166, + "learning_rate": 0.0001319149012229075, + "loss": 0.19775952100753785, + "mean_token_accuracy": 0.9339428559327737, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.3448961910813354, + "eval_loss": 0.6750120520591736, + "eval_mean_token_accuracy": 0.8487970232963562, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.1169, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 2020 + }, + { + "entropy": 0.21423916313797237, + "epoch": 5.074719800747198, + "grad_norm": 0.6934391856193542, + "learning_rate": 0.00012997457388105022, + "loss": 0.1439570426940918, + "mean_token_accuracy": 0.9528236843645572, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.3570949243771475, + "eval_loss": 0.6465504169464111, + "eval_mean_token_accuracy": 0.8490785547467166, + "eval_num_tokens": 4763269.0, + "eval_runtime": 85.9574, + "eval_samples_per_second": 15.996, + "eval_steps_per_second": 2.001, + "step": 2040 + }, + { + "entropy": 0.20838565267622472, + "epoch": 5.12453300124533, + "grad_norm": 0.7286986112594604, + "learning_rate": 0.00012802916937942972, + "loss": 0.14467307329177856, + "mean_token_accuracy": 0.950994835793972, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.3452463157821533, + "eval_loss": 0.6705958843231201, + "eval_mean_token_accuracy": 0.8490352796953778, + "eval_num_tokens": 4809047.0, + "eval_runtime": 86.228, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 2060 + }, + { + "entropy": 0.20453082229942082, + "epoch": 5.174346201743462, + "grad_norm": 0.7515555620193481, + "learning_rate": 0.00012607927442550974, + "loss": 0.13732000589370727, + "mean_token_accuracy": 0.9537357829511166, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.32431264914745506, + "eval_loss": 0.6743043065071106, + "eval_mean_token_accuracy": 0.8504878629085629, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.5948, + "eval_samples_per_second": 15.879, + "eval_steps_per_second": 1.986, + "step": 2080 + }, + { + "entropy": 0.21812320686876774, + "epoch": 5.224159402241594, + "grad_norm": 0.9093465209007263, + "learning_rate": 0.0001241254770810132, + "loss": 0.14311420917510986, + "mean_token_accuracy": 0.9514068141579628, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.33086285835435225, + "eval_loss": 0.6676449179649353, + "eval_mean_token_accuracy": 0.8505287662495015, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 2100 + }, + { + "entropy": 0.2180163251236081, + "epoch": 5.273972602739726, + "grad_norm": 0.6703007221221924, + "learning_rate": 0.00012216836658457075, + "loss": 0.14803968667984008, + "mean_token_accuracy": 0.9521303348243236, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.33162341708707255, + "eval_loss": 0.6658875942230225, + "eval_mean_token_accuracy": 0.8500757605530495, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.6296, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 2120 + }, + { + "entropy": 0.22511130161583423, + "epoch": 5.323785803237858, + "grad_norm": 0.8078880906105042, + "learning_rate": 0.00012020853317401455, + "loss": 0.15228408575057983, + "mean_token_accuracy": 0.947144789993763, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3354601170434508, + "eval_loss": 0.6677829623222351, + "eval_mean_token_accuracy": 0.8482600024273229, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.4689, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.989, + "step": 2140 + }, + { + "entropy": 0.2244176059961319, + "epoch": 5.37359900373599, + "grad_norm": 0.9636075496673584, + "learning_rate": 0.00011824656790837037, + "loss": 0.15260883569717407, + "mean_token_accuracy": 0.9471467643976211, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.3381616926297199, + "eval_loss": 0.6694412231445312, + "eval_mean_token_accuracy": 0.8482369603805764, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.4147, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 2160 + }, + { + "entropy": 0.22982364390045404, + "epoch": 5.423412204234122, + "grad_norm": 0.775401771068573, + "learning_rate": 0.00011628306248960262, + "loss": 0.15140302181243898, + "mean_token_accuracy": 0.9492553934454918, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.3305150235808173, + "eval_loss": 0.6717822551727295, + "eval_mean_token_accuracy": 0.8489849723355715, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.4728, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.989, + "step": 2180 + }, + { + "entropy": 0.21448935717344284, + "epoch": 5.473225404732254, + "grad_norm": 0.6575281023979187, + "learning_rate": 0.00011431860908416465, + "loss": 0.1452319622039795, + "mean_token_accuracy": 0.9505287684500218, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3488145174328671, + "eval_loss": 0.6612305641174316, + "eval_mean_token_accuracy": 0.8492907808963642, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6927, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 2200 + }, + { + "entropy": 0.23091202937066554, + "epoch": 5.523038605230386, + "grad_norm": 0.8909686207771301, + "learning_rate": 0.00011235380014440985, + "loss": 0.15150139331817628, + "mean_token_accuracy": 0.9497875183820724, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.3268539015810157, + "eval_loss": 0.6667542457580566, + "eval_mean_token_accuracy": 0.8499062903398691, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.4644, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 2220 + }, + { + "entropy": 0.2227974807843566, + "epoch": 5.572851805728518, + "grad_norm": 0.6180275082588196, + "learning_rate": 0.0001103892282299158, + "loss": 0.1491069197654724, + "mean_token_accuracy": 0.9488144010305405, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3346347655494546, + "eval_loss": 0.6665948629379272, + "eval_mean_token_accuracy": 0.8499961893918903, + "eval_num_tokens": 5226864.0, + "eval_runtime": 87.0548, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.976, + "step": 2240 + }, + { + "entropy": 0.21368421968072654, + "epoch": 5.62266500622665, + "grad_norm": 0.6004369258880615, + "learning_rate": 0.00010842548582877651, + "loss": 0.14485255479812623, + "mean_token_accuracy": 0.9502056457102299, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.32753298804163933, + "eval_loss": 0.6680151224136353, + "eval_mean_token_accuracy": 0.8515451086121936, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.8524, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.98, + "step": 2260 + }, + { + "entropy": 0.2103635374456644, + "epoch": 5.672478206724782, + "grad_norm": 0.699174702167511, + "learning_rate": 0.00010646316517891613, + "loss": 0.14297772645950318, + "mean_token_accuracy": 0.9512537539005279, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.32966585959806, + "eval_loss": 0.675578773021698, + "eval_mean_token_accuracy": 0.8509623023659684, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.4518, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.99, + "step": 2280 + }, + { + "entropy": 0.22516900151968003, + "epoch": 5.722291407222914, + "grad_norm": 0.6637354493141174, + "learning_rate": 0.00010450285808947797, + "loss": 0.15202572345733642, + "mean_token_accuracy": 0.9482452072203159, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3369456917740578, + "eval_loss": 0.6697061061859131, + "eval_mean_token_accuracy": 0.848603522361711, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.6371, + "eval_samples_per_second": 15.871, + "eval_steps_per_second": 1.985, + "step": 2300 + }, + { + "entropy": 0.21841065725311637, + "epoch": 5.772104607721046, + "grad_norm": 0.7940268516540527, + "learning_rate": 0.00010254515576234297, + "loss": 0.14710167646408082, + "mean_token_accuracy": 0.9493498183786869, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3237486180177955, + "eval_loss": 0.6779657602310181, + "eval_mean_token_accuracy": 0.8500715313955794, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.1826, + "eval_samples_per_second": 15.954, + "eval_steps_per_second": 1.996, + "step": 2320 + }, + { + "entropy": 0.22146204356104135, + "epoch": 5.821917808219178, + "grad_norm": 0.9234833121299744, + "learning_rate": 0.00010059064861383132, + "loss": 0.14720046520233154, + "mean_token_accuracy": 0.9493872679769992, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.32365207564692167, + "eval_loss": 0.6704005002975464, + "eval_mean_token_accuracy": 0.8507985760306203, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.5494, + "eval_samples_per_second": 15.887, + "eval_steps_per_second": 1.987, + "step": 2340 + }, + { + "entropy": 0.20934011954814197, + "epoch": 5.87173100871731, + "grad_norm": 0.5547503232955933, + "learning_rate": 9.863992609664084e-05, + "loss": 0.1464867353439331, + "mean_token_accuracy": 0.9503875687718392, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.3330401429083458, + "eval_loss": 0.6659091114997864, + "eval_mean_token_accuracy": 0.8504848906467127, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.5855, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 2360 + }, + { + "entropy": 0.21678635366261007, + "epoch": 5.921544209215442, + "grad_norm": 0.570612907409668, + "learning_rate": 9.669357652207635e-05, + "loss": 0.14821385145187377, + "mean_token_accuracy": 0.9503940217196941, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3322022325077722, + "eval_loss": 0.6722489595413208, + "eval_mean_token_accuracy": 0.8489979422369669, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.2986, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 2380 + }, + { + "entropy": 0.20932920072227718, + "epoch": 5.971357409713574, + "grad_norm": 0.7879557609558105, + "learning_rate": 9.475218688262262e-05, + "loss": 0.14675841331481934, + "mean_token_accuracy": 0.9507176131010056, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.3199348642902319, + "eval_loss": 0.6698136329650879, + "eval_mean_token_accuracy": 0.8514142130003419, + "eval_num_tokens": 5605400.0, + "eval_runtime": 85.8995, + "eval_samples_per_second": 16.007, + "eval_steps_per_second": 2.002, + "step": 2400 + }, + { + "entropy": 0.21032143919131693, + "epoch": 6.019925280199253, + "grad_norm": 0.5823076367378235, + "learning_rate": 9.281634267491569e-05, + "loss": 0.13322267532348633, + "mean_token_accuracy": 0.9550939072401096, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.30206270117399303, + "eval_loss": 0.7093168497085571, + "eval_mean_token_accuracy": 0.8500627639681794, + "eval_num_tokens": 5648968.0, + "eval_runtime": 85.8128, + "eval_samples_per_second": 16.023, + "eval_steps_per_second": 2.004, + "step": 2420 + }, + { + "entropy": 0.1534628233872354, + "epoch": 6.069738480697385, + "grad_norm": 0.710133969783783, + "learning_rate": 9.088662772316508e-05, + "loss": 0.09078952670097351, + "mean_token_accuracy": 0.9678447999060154, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.28208133101809857, + "eval_loss": 0.7636417150497437, + "eval_mean_token_accuracy": 0.8494061477655588, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9724, + "eval_samples_per_second": 15.994, + "eval_steps_per_second": 2.001, + "step": 2440 + }, + { + "entropy": 0.16151462448760867, + "epoch": 6.119551681195516, + "grad_norm": 0.5793812274932861, + "learning_rate": 8.896362400308028e-05, + "loss": 0.09545697569847107, + "mean_token_accuracy": 0.9671573750674725, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.2833245605403601, + "eval_loss": 0.7402405738830566, + "eval_mean_token_accuracy": 0.8503523728875226, + "eval_num_tokens": 5745090.0, + "eval_runtime": 85.5461, + "eval_samples_per_second": 16.073, + "eval_steps_per_second": 2.011, + "step": 2460 + }, + { + "entropy": 0.15203177919611335, + "epoch": 6.169364881693649, + "grad_norm": 0.4251123368740082, + "learning_rate": 8.704791146635483e-05, + "loss": 0.09420782327651978, + "mean_token_accuracy": 0.9677386932075024, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.28572545962971313, + "eval_loss": 0.735416829586029, + "eval_mean_token_accuracy": 0.8487084663884584, + "eval_num_tokens": 5790333.0, + "eval_runtime": 85.4801, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.012, + "step": 2480 + }, + { + "entropy": 0.15587336672469973, + "epoch": 6.219178082191781, + "grad_norm": 0.4357028007507324, + "learning_rate": 8.514006786576085e-05, + "loss": 0.09429320096969604, + "mean_token_accuracy": 0.9682952925562859, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.2859006894882335, + "eval_loss": 0.7347224950790405, + "eval_mean_token_accuracy": 0.8501905518215757, + "eval_num_tokens": 5837321.0, + "eval_runtime": 85.7578, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.006, + "step": 2500 + }, + { + "entropy": 0.15765639198943973, + "epoch": 6.268991282689913, + "grad_norm": 0.47331130504608154, + "learning_rate": 8.324066858090663e-05, + "loss": 0.09571113586425781, + "mean_token_accuracy": 0.9683481335639954, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.29231513846059176, + "eval_loss": 0.7392512559890747, + "eval_mean_token_accuracy": 0.8486633983462356, + "eval_num_tokens": 5884398.0, + "eval_runtime": 85.7846, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.005, + "step": 2520 + }, + { + "entropy": 0.16176860257983208, + "epoch": 6.318804483188045, + "grad_norm": 0.6142018437385559, + "learning_rate": 8.135028644470992e-05, + "loss": 0.09486144185066223, + "mean_token_accuracy": 0.9682316601276397, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.2851274753379267, + "eval_loss": 0.7520816922187805, + "eval_mean_token_accuracy": 0.8501113649717597, + "eval_num_tokens": 5929876.0, + "eval_runtime": 85.9425, + "eval_samples_per_second": 15.999, + "eval_steps_per_second": 2.001, + "step": 2540 + }, + { + "entropy": 0.15404034564271568, + "epoch": 6.3686176836861765, + "grad_norm": 0.6051287651062012, + "learning_rate": 7.946949157063964e-05, + "loss": 0.09280472993850708, + "mean_token_accuracy": 0.9684635892510414, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28802703563557114, + "eval_loss": 0.7439162135124207, + "eval_mean_token_accuracy": 0.8499851770872293, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.0703, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.998, + "step": 2560 + }, + { + "entropy": 0.15343588953837753, + "epoch": 6.418430884184309, + "grad_norm": 0.4823743402957916, + "learning_rate": 7.759885118077701e-05, + "loss": 0.09000591039657593, + "mean_token_accuracy": 0.9699928767979145, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2795634938533916, + "eval_loss": 0.7647850513458252, + "eval_mean_token_accuracy": 0.8503464397995971, + "eval_num_tokens": 6025380.0, + "eval_runtime": 85.8886, + "eval_samples_per_second": 16.009, + "eval_steps_per_second": 2.003, + "step": 2580 + }, + { + "entropy": 0.15740026142448188, + "epoch": 6.468244084682441, + "grad_norm": 0.5082696676254272, + "learning_rate": 7.57389294347494e-05, + "loss": 0.09191849827766418, + "mean_token_accuracy": 0.9692809768021107, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2913342311458532, + "eval_loss": 0.7518694996833801, + "eval_mean_token_accuracy": 0.8483168302580367, + "eval_num_tokens": 6073349.0, + "eval_runtime": 85.5761, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.01, + "step": 2600 + }, + { + "entropy": 0.15922069251537324, + "epoch": 6.518057285180573, + "grad_norm": 0.3995199501514435, + "learning_rate": 7.389028725958736e-05, + "loss": 0.09584367871284485, + "mean_token_accuracy": 0.9685114495456218, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.2863075934177221, + "eval_loss": 0.7539381384849548, + "eval_mean_token_accuracy": 0.8507507083027862, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.112, + "eval_samples_per_second": 15.968, + "eval_steps_per_second": 1.997, + "step": 2620 + }, + { + "entropy": 0.16197575423866512, + "epoch": 6.567870485678705, + "grad_norm": 0.534295380115509, + "learning_rate": 7.205348218055678e-05, + "loss": 0.0961170256137848, + "mean_token_accuracy": 0.9674530044198036, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.29021967315050057, + "eval_loss": 0.751198947429657, + "eval_mean_token_accuracy": 0.8509796344956686, + "eval_num_tokens": 6165523.0, + "eval_runtime": 85.7958, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.005, + "step": 2640 + }, + { + "entropy": 0.15261746793985367, + "epoch": 6.617683686176837, + "grad_norm": 0.5391237139701843, + "learning_rate": 7.022906815301673e-05, + "loss": 0.0926026999950409, + "mean_token_accuracy": 0.9695659473538398, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.29128045216202736, + "eval_loss": 0.7450292110443115, + "eval_mean_token_accuracy": 0.8498771443616512, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.3963, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 2660 + }, + { + "entropy": 0.16164180357009172, + "epoch": 6.667496886674969, + "grad_norm": 0.5767946243286133, + "learning_rate": 6.841759539535419e-05, + "loss": 0.09291981458663941, + "mean_token_accuracy": 0.9687136687338352, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2897637223088464, + "eval_loss": 0.7503410577774048, + "eval_mean_token_accuracy": 0.8503315164599308, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.0653, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.998, + "step": 2680 + }, + { + "entropy": 0.17062523355707526, + "epoch": 6.717310087173101, + "grad_norm": 0.4974168539047241, + "learning_rate": 6.661961022304563e-05, + "loss": 0.09713236689567566, + "mean_token_accuracy": 0.9661971725523472, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2765843396963075, + "eval_loss": 0.7604002356529236, + "eval_mean_token_accuracy": 0.8521115277395692, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.1676, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 2700 + }, + { + "entropy": 0.17544092936441302, + "epoch": 6.767123287671232, + "grad_norm": 0.5523537993431091, + "learning_rate": 6.483565488389582e-05, + "loss": 0.09709116220474243, + "mean_token_accuracy": 0.9650957375764847, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.27939334659035814, + "eval_loss": 0.7534670829772949, + "eval_mean_token_accuracy": 0.851230604010959, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.2913, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 2720 + }, + { + "entropy": 0.15991022661328316, + "epoch": 6.816936488169365, + "grad_norm": 0.478551983833313, + "learning_rate": 6.306626739450311e-05, + "loss": 0.09564646482467651, + "mean_token_accuracy": 0.9679084822535515, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.27878295491601146, + "eval_loss": 0.7519959211349487, + "eval_mean_token_accuracy": 0.8510654949864676, + "eval_num_tokens": 6397720.0, + "eval_runtime": 85.9109, + "eval_samples_per_second": 16.005, + "eval_steps_per_second": 2.002, + "step": 2740 + }, + { + "entropy": 0.16824879590421915, + "epoch": 6.866749688667497, + "grad_norm": 0.6681098937988281, + "learning_rate": 6.131198137800108e-05, + "loss": 0.0962279736995697, + "mean_token_accuracy": 0.966830012947321, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.2834690434121808, + "eval_loss": 0.751922070980072, + "eval_mean_token_accuracy": 0.8521237577809844, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.3618, + "eval_samples_per_second": 15.921, + "eval_steps_per_second": 1.992, + "step": 2760 + }, + { + "entropy": 0.1518704930320382, + "epoch": 6.916562889165629, + "grad_norm": 0.5201290249824524, + "learning_rate": 5.957332590312513e-05, + "loss": 0.09010660648345947, + "mean_token_accuracy": 0.9693463340401649, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.28485129617674404, + "eval_loss": 0.7452457547187805, + "eval_mean_token_accuracy": 0.8512036796919135, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.4524, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.99, + "step": 2780 + }, + { + "entropy": 0.15512610590085388, + "epoch": 6.966376089663761, + "grad_norm": 0.42802050709724426, + "learning_rate": 5.785082532465233e-05, + "loss": 0.09320432543754578, + "mean_token_accuracy": 0.9686134628951549, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.27554594526110693, + "eval_loss": 0.7644653916358948, + "eval_mean_token_accuracy": 0.8513738523389018, + "eval_num_tokens": 6540175.0, + "eval_runtime": 85.7609, + "eval_samples_per_second": 16.033, + "eval_steps_per_second": 2.006, + "step": 2800 + }, + { + "entropy": 0.17524497526196334, + "epoch": 7.01494396014944, + "grad_norm": 0.3330269157886505, + "learning_rate": 5.6144999125263545e-05, + "loss": 0.0895616888999939, + "mean_token_accuracy": 0.9682766932707566, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.2735865569218647, + "eval_loss": 0.768479585647583, + "eval_mean_token_accuracy": 0.8503459383581959, + "eval_num_tokens": 6583767.0, + "eval_runtime": 85.7162, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.007, + "step": 2820 + }, + { + "entropy": 0.1403565663844347, + "epoch": 7.064757160647572, + "grad_norm": 0.35613498091697693, + "learning_rate": 5.4456361758874235e-05, + "loss": 0.07551313638687134, + "mean_token_accuracy": 0.9739301167428493, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.25941789089593775, + "eval_loss": 0.8209511637687683, + "eval_mean_token_accuracy": 0.8505055855873019, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.0943, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 2840 + }, + { + "entropy": 0.13500106502324344, + "epoch": 7.114570361145703, + "grad_norm": 0.34418627619743347, + "learning_rate": 5.2785422495482234e-05, + "loss": 0.07293946146965027, + "mean_token_accuracy": 0.9747208289802074, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.26482899772912954, + "eval_loss": 0.798904538154602, + "eval_mean_token_accuracy": 0.8511530233677044, + "eval_num_tokens": 6672946.0, + "eval_runtime": 85.7915, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.005, + "step": 2860 + }, + { + "entropy": 0.13127502552233636, + "epoch": 7.164383561643835, + "grad_norm": 0.4638441503047943, + "learning_rate": 5.113268526757892e-05, + "loss": 0.07121461629867554, + "mean_token_accuracy": 0.9756786689162255, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2645381211714689, + "eval_loss": 0.809101939201355, + "eval_mean_token_accuracy": 0.8514727898115335, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.84, + "eval_samples_per_second": 16.018, + "eval_steps_per_second": 2.004, + "step": 2880 + }, + { + "entropy": 0.1331390908919275, + "epoch": 7.214196762141968, + "grad_norm": 0.40206775069236755, + "learning_rate": 4.949864851817007e-05, + "loss": 0.07188264131546021, + "mean_token_accuracy": 0.9755406074225903, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.26244733283339544, + "eval_loss": 0.8143188953399658, + "eval_mean_token_accuracy": 0.8514358189909957, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.8546, + "eval_samples_per_second": 16.015, + "eval_steps_per_second": 2.003, + "step": 2900 + }, + { + "entropy": 0.13647331558167936, + "epoch": 7.2640099626401, + "grad_norm": 0.26405787467956543, + "learning_rate": 4.788380505045224e-05, + "loss": 0.07412450313568116, + "mean_token_accuracy": 0.9744274213910102, + "num_tokens": 6809678.0, + "step": 2920 + }, + { + "epoch": 7.2640099626401, + "eval_entropy": 0.2626111418182074, + "eval_loss": 0.8111525177955627, + "eval_mean_token_accuracy": 0.8512121695418691, + "eval_num_tokens": 6809678.0, + "eval_runtime": 85.9626, + "eval_samples_per_second": 15.995, + "eval_steps_per_second": 2.001, + "step": 2920 + }, + { + "entropy": 0.12644002586603165, + "epoch": 7.313823163138232, + "grad_norm": 0.27514681220054626, + "learning_rate": 4.6288641879189884e-05, + "loss": 0.06807711124420165, + "mean_token_accuracy": 0.9760703906416893, + "num_tokens": 6860750.0, + "step": 2940 + }, + { + "epoch": 7.313823163138232, + "eval_entropy": 0.26096762734097106, + "eval_loss": 0.8184595108032227, + "eval_mean_token_accuracy": 0.8501476153384807, + "eval_num_tokens": 6860750.0, + "eval_runtime": 85.9521, + "eval_samples_per_second": 15.997, + "eval_steps_per_second": 2.001, + "step": 2940 + }, + { + "entropy": 0.13920630998909472, + "epoch": 7.363636363636363, + "grad_norm": 0.23584705591201782, + "learning_rate": 4.4713640083838604e-05, + "loss": 0.07301607131958007, + "mean_token_accuracy": 0.9745715200901032, + "num_tokens": 6907092.0, + "step": 2960 + }, + { + "epoch": 7.363636363636363, + "eval_entropy": 0.2612536767021168, + "eval_loss": 0.8116245269775391, + "eval_mean_token_accuracy": 0.8510967350976412, + "eval_num_tokens": 6907092.0, + "eval_runtime": 85.6373, + "eval_samples_per_second": 16.056, + "eval_steps_per_second": 2.008, + "step": 2960 + }, + { + "entropy": 0.1349492883309722, + "epoch": 7.4134495641344955, + "grad_norm": 0.24552719295024872, + "learning_rate": 4.315927466345791e-05, + "loss": 0.07397544980049134, + "mean_token_accuracy": 0.9745095103979111, + "num_tokens": 6952700.0, + "step": 2980 + }, + { + "epoch": 7.4134495641344955, + "eval_entropy": 0.25796533306670744, + "eval_loss": 0.8266491293907166, + "eval_mean_token_accuracy": 0.8511653857868772, + "eval_num_tokens": 6952700.0, + "eval_runtime": 85.7462, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.006, + "step": 2980 + }, + { + "entropy": 0.14479175000451505, + "epoch": 7.463262764632628, + "grad_norm": 0.2846072018146515, + "learning_rate": 4.162601439345814e-05, + "loss": 0.07544798254966736, + "mean_token_accuracy": 0.9727819666266442, + "num_tokens": 6996430.0, + "step": 3000 + }, + { + "epoch": 7.463262764632628, + "eval_entropy": 0.2584348309698493, + "eval_loss": 0.8253348469734192, + "eval_mean_token_accuracy": 0.8511569815319638, + "eval_num_tokens": 6996430.0, + "eval_runtime": 86.2984, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 3000 + }, + { + "entropy": 0.14114196319133043, + "epoch": 7.51307596513076, + "grad_norm": 0.407966285943985, + "learning_rate": 4.011432168422419e-05, + "loss": 0.0736398994922638, + "mean_token_accuracy": 0.9741654269397259, + "num_tokens": 7042038.0, + "step": 3020 + }, + { + "epoch": 7.51307596513076, + "eval_entropy": 0.25232676260693127, + "eval_loss": 0.8296052813529968, + "eval_mean_token_accuracy": 0.8523298349491385, + "eval_num_tokens": 7042038.0, + "eval_runtime": 85.8445, + "eval_samples_per_second": 16.017, + "eval_steps_per_second": 2.004, + "step": 3020 + }, + { + "entropy": 0.1353456223383546, + "epoch": 7.562889165628892, + "grad_norm": 0.2712634801864624, + "learning_rate": 3.8624652441658684e-05, + "loss": 0.07362412214279175, + "mean_token_accuracy": 0.9747945807874203, + "num_tokens": 7089390.0, + "step": 3040 + }, + { + "epoch": 7.562889165628892, + "eval_entropy": 0.2579477243991785, + "eval_loss": 0.8274564743041992, + "eval_mean_token_accuracy": 0.8517705212498821, + "eval_num_tokens": 7089390.0, + "eval_runtime": 85.8222, + "eval_samples_per_second": 16.022, + "eval_steps_per_second": 2.004, + "step": 3040 + }, + { + "entropy": 0.1296080862637609, + "epoch": 7.6127023661270234, + "grad_norm": 0.2371893972158432, + "learning_rate": 3.715745592968707e-05, + "loss": 0.06971035599708557, + "mean_token_accuracy": 0.9759043246507645, + "num_tokens": 7138002.0, + "step": 3060 + }, + { + "epoch": 7.6127023661270234, + "eval_entropy": 0.25391967083479083, + "eval_loss": 0.8197130560874939, + "eval_mean_token_accuracy": 0.8522267875283264, + "eval_num_tokens": 7138002.0, + "eval_runtime": 85.8796, + "eval_samples_per_second": 16.011, + "eval_steps_per_second": 2.003, + "step": 3060 + }, + { + "entropy": 0.1311203008517623, + "epoch": 7.662515566625156, + "grad_norm": 0.22499267756938934, + "learning_rate": 3.5713174634765967e-05, + "loss": 0.07176244258880615, + "mean_token_accuracy": 0.9754939571022987, + "num_tokens": 7185520.0, + "step": 3080 + }, + { + "epoch": 7.662515566625156, + "eval_entropy": 0.2526215241225653, + "eval_loss": 0.8265154361724854, + "eval_mean_token_accuracy": 0.8519952584837758, + "eval_num_tokens": 7185520.0, + "eval_runtime": 85.8746, + "eval_samples_per_second": 16.012, + "eval_steps_per_second": 2.003, + "step": 3080 + }, + { + "entropy": 0.13420484317466616, + "epoch": 7.712328767123288, + "grad_norm": 0.2398064285516739, + "learning_rate": 3.4292244132434866e-05, + "loss": 0.07559212446212768, + "mean_token_accuracy": 0.9743142127990723, + "num_tokens": 7232170.0, + "step": 3100 + }, + { + "epoch": 7.712328767123288, + "eval_entropy": 0.2484562756537005, + "eval_loss": 0.8312150239944458, + "eval_mean_token_accuracy": 0.8528405119513356, + "eval_num_tokens": 7232170.0, + "eval_runtime": 85.7896, + "eval_samples_per_second": 16.028, + "eval_steps_per_second": 2.005, + "step": 3100 + }, + { + "entropy": 0.11965563679113984, + "epoch": 7.76214196762142, + "grad_norm": 0.3408384919166565, + "learning_rate": 3.2895092955952746e-05, + "loss": 0.0661750853061676, + "mean_token_accuracy": 0.9776600524783134, + "num_tokens": 7282846.0, + "step": 3120 + }, + { + "epoch": 7.76214196762142, + "eval_entropy": 0.2522421533804993, + "eval_loss": 0.8327009677886963, + "eval_mean_token_accuracy": 0.8524222023958383, + "eval_num_tokens": 7282846.0, + "eval_runtime": 86.1769, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 1.996, + "step": 3120 + }, + { + "entropy": 0.13388084415346385, + "epoch": 7.811955168119551, + "grad_norm": 0.35418516397476196, + "learning_rate": 3.152214246705829e-05, + "loss": 0.07149899601936341, + "mean_token_accuracy": 0.9747635535895824, + "num_tokens": 7331518.0, + "step": 3140 + }, + { + "epoch": 7.811955168119551, + "eval_entropy": 0.25038352296795957, + "eval_loss": 0.836457371711731, + "eval_mean_token_accuracy": 0.8526130665180295, + "eval_num_tokens": 7331518.0, + "eval_runtime": 85.6099, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.009, + "step": 3140 + }, + { + "entropy": 0.13530643959529698, + "epoch": 7.861768368617684, + "grad_norm": 0.38060539960861206, + "learning_rate": 3.017380672889291e-05, + "loss": 0.07116585969924927, + "mean_token_accuracy": 0.973284512758255, + "num_tokens": 7379056.0, + "step": 3160 + }, + { + "epoch": 7.861768368617684, + "eval_entropy": 0.255092611319797, + "eval_loss": 0.8314701914787292, + "eval_mean_token_accuracy": 0.8520913099826768, + "eval_num_tokens": 7379056.0, + "eval_runtime": 85.877, + "eval_samples_per_second": 16.011, + "eval_steps_per_second": 2.003, + "step": 3160 + }, + { + "entropy": 0.13383390177041293, + "epoch": 7.911581569115816, + "grad_norm": 0.3827536106109619, + "learning_rate": 2.8850492381124808e-05, + "loss": 0.07305437326431274, + "mean_token_accuracy": 0.9750778004527092, + "num_tokens": 7424770.0, + "step": 3180 + }, + { + "epoch": 7.911581569115816, + "eval_entropy": 0.25416371157003004, + "eval_loss": 0.8206402063369751, + "eval_mean_token_accuracy": 0.852779901651449, + "eval_num_tokens": 7424770.0, + "eval_runtime": 86.1015, + "eval_samples_per_second": 15.97, + "eval_steps_per_second": 1.998, + "step": 3180 + }, + { + "entropy": 0.1395680439658463, + "epoch": 7.961394769613948, + "grad_norm": 0.3809775412082672, + "learning_rate": 2.7552598517312256e-05, + "loss": 0.07236042022705078, + "mean_token_accuracy": 0.9731538116931915, + "num_tokens": 7470804.0, + "step": 3200 + }, + { + "epoch": 7.961394769613948, + "eval_entropy": 0.25528111975899964, + "eval_loss": 0.8230037093162537, + "eval_mean_token_accuracy": 0.8526452603035195, + "eval_num_tokens": 7470804.0, + "eval_runtime": 85.7895, + "eval_samples_per_second": 16.028, + "eval_steps_per_second": 2.005, + "step": 3200 + }, + { + "entropy": 0.12193699864049752, + "epoch": 8.009962640099626, + "grad_norm": 0.11854425817728043, + "learning_rate": 2.6280516564542205e-05, + "loss": 0.06617764234542847, + "mean_token_accuracy": 0.977179691577569, + "num_tokens": 7518110.0, + "step": 3220 + }, + { + "epoch": 8.009962640099626, + "eval_entropy": 0.25100527677771656, + "eval_loss": 0.8393343687057495, + "eval_mean_token_accuracy": 0.8522553132023922, + "eval_num_tokens": 7518110.0, + "eval_runtime": 85.8837, + "eval_samples_per_second": 16.01, + "eval_steps_per_second": 2.003, + "step": 3220 + }, + { + "entropy": 0.12788885813206435, + "epoch": 8.059775840597759, + "grad_norm": 0.16094881296157837, + "learning_rate": 2.50346301653812e-05, + "loss": 0.06274186968803405, + "mean_token_accuracy": 0.9766994707286358, + "num_tokens": 7565539.0, + "step": 3240 + }, + { + "epoch": 8.059775840597759, + "eval_entropy": 0.24409458682287571, + "eval_loss": 0.874617338180542, + "eval_mean_token_accuracy": 0.8521041180505309, + "eval_num_tokens": 7565539.0, + "eval_runtime": 86.2656, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 3240 + }, + { + "entropy": 0.12464155335910618, + "epoch": 8.10958904109589, + "grad_norm": 0.16893954575061798, + "learning_rate": 2.381531506217437e-05, + "loss": 0.06093020439147949, + "mean_token_accuracy": 0.9776258453726768, + "num_tokens": 7612578.0, + "step": 3260 + }, + { + "epoch": 8.10958904109589, + "eval_entropy": 0.24396493017326953, + "eval_loss": 0.891161322593689, + "eval_mean_token_accuracy": 0.8515338024427724, + "eval_num_tokens": 7612578.0, + "eval_runtime": 85.9061, + "eval_samples_per_second": 16.006, + "eval_steps_per_second": 2.002, + "step": 3260 + }, + { + "entropy": 0.12345920228399336, + "epoch": 8.159402241594023, + "grad_norm": 0.14332273602485657, + "learning_rate": 2.262293898372616e-05, + "loss": 0.061289966106414795, + "mean_token_accuracy": 0.9762230902910233, + "num_tokens": 7660157.0, + "step": 3280 + }, + { + "epoch": 8.159402241594023, + "eval_entropy": 0.2481445314059424, + "eval_loss": 0.8922848105430603, + "eval_mean_token_accuracy": 0.8514944855556932, + "eval_num_tokens": 7660157.0, + "eval_runtime": 85.5201, + "eval_samples_per_second": 16.078, + "eval_steps_per_second": 2.011, + "step": 3280 + }, + { + "entropy": 0.12298110066913068, + "epoch": 8.209215442092155, + "grad_norm": 0.21848882734775543, + "learning_rate": 2.1457861534398633e-05, + "loss": 0.05986443758010864, + "mean_token_accuracy": 0.9786281704902648, + "num_tokens": 7709745.0, + "step": 3300 + }, + { + "epoch": 8.209215442092155, + "eval_entropy": 0.24329388124305149, + "eval_loss": 0.9021085500717163, + "eval_mean_token_accuracy": 0.8521762625422589, + "eval_num_tokens": 7709745.0, + "eval_runtime": 85.955, + "eval_samples_per_second": 15.997, + "eval_steps_per_second": 2.001, + "step": 3300 + }, + { + "entropy": 0.13265180448070168, + "epoch": 8.259028642590286, + "grad_norm": 0.18067947030067444, + "learning_rate": 2.0320434085659692e-05, + "loss": 0.06724961400032044, + "mean_token_accuracy": 0.975098168104887, + "num_tokens": 7753571.0, + "step": 3320 + }, + { + "epoch": 8.259028642590286, + "eval_entropy": 0.2433211464694766, + "eval_loss": 0.9094350337982178, + "eval_mean_token_accuracy": 0.8520150094531304, + "eval_num_tokens": 7753571.0, + "eval_runtime": 85.7989, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.005, + "step": 3320 + }, + { + "entropy": 0.11949320202693343, + "epoch": 8.308841843088418, + "grad_norm": 0.17020289599895477, + "learning_rate": 1.9210999670114196e-05, + "loss": 0.0634455680847168, + "mean_token_accuracy": 0.9771294385194779, + "num_tokens": 7799310.0, + "step": 3340 + }, + { + "epoch": 8.308841843088418, + "eval_entropy": 0.24345201219237128, + "eval_loss": 0.9021793603897095, + "eval_mean_token_accuracy": 0.8520745697409607, + "eval_num_tokens": 7799310.0, + "eval_runtime": 86.0883, + "eval_samples_per_second": 15.972, + "eval_steps_per_second": 1.998, + "step": 3340 + }, + { + "entropy": 0.12065747743472457, + "epoch": 8.35865504358655, + "grad_norm": 0.16789060831069946, + "learning_rate": 1.8129892878049886e-05, + "loss": 0.061494195461273195, + "mean_token_accuracy": 0.9779584899544715, + "num_tokens": 7846447.0, + "step": 3360 + }, + { + "epoch": 8.35865504358655, + "eval_entropy": 0.24093415042342142, + "eval_loss": 0.9006755352020264, + "eval_mean_token_accuracy": 0.852174230786257, + "eval_num_tokens": 7846447.0, + "eval_runtime": 85.9011, + "eval_samples_per_second": 16.007, + "eval_steps_per_second": 2.002, + "step": 3360 + }, + { + "entropy": 0.13125578537583352, + "epoch": 8.408468244084682, + "grad_norm": 0.1662452220916748, + "learning_rate": 1.70774397565298e-05, + "loss": 0.06685600876808166, + "mean_token_accuracy": 0.9744067586958408, + "num_tokens": 7890283.0, + "step": 3380 + }, + { + "epoch": 8.408468244084682, + "eval_entropy": 0.24062153688350388, + "eval_loss": 0.9078915119171143, + "eval_mean_token_accuracy": 0.8523201647886011, + "eval_num_tokens": 7890283.0, + "eval_runtime": 86.0201, + "eval_samples_per_second": 15.985, + "eval_steps_per_second": 2.0, + "step": 3380 + }, + { + "entropy": 0.11986117120832204, + "epoch": 8.458281444582815, + "grad_norm": 0.19571948051452637, + "learning_rate": 1.6053957711060606e-05, + "loss": 0.06411095261573792, + "mean_token_accuracy": 0.9770627245306969, + "num_tokens": 7936518.0, + "step": 3400 + }, + { + "epoch": 8.458281444582815, + "eval_entropy": 0.24352820347561394, + "eval_loss": 0.9058943390846252, + "eval_mean_token_accuracy": 0.8519382792156797, + "eval_num_tokens": 7936518.0, + "eval_runtime": 85.966, + "eval_samples_per_second": 15.995, + "eval_steps_per_second": 2.001, + "step": 3400 + }, + { + "entropy": 0.12857897616922856, + "epoch": 8.508094645080947, + "grad_norm": 0.2609264850616455, + "learning_rate": 1.5059755409867613e-05, + "loss": 0.06473397612571716, + "mean_token_accuracy": 0.9764650195837021, + "num_tokens": 7981966.0, + "step": 3420 + }, + { + "epoch": 8.508094645080947, + "eval_entropy": 0.24032609000108962, + "eval_loss": 0.9077776074409485, + "eval_mean_token_accuracy": 0.8517829197090726, + "eval_num_tokens": 7981966.0, + "eval_runtime": 86.6059, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 3420 + }, + { + "entropy": 0.12348870886489749, + "epoch": 8.557907845579079, + "grad_norm": 0.19537609815597534, + "learning_rate": 1.409513269080473e-05, + "loss": 0.06481348872184753, + "mean_token_accuracy": 0.9769559659063816, + "num_tokens": 8028367.0, + "step": 3440 + }, + { + "epoch": 8.557907845579079, + "eval_entropy": 0.2404322574824788, + "eval_loss": 0.9057720899581909, + "eval_mean_token_accuracy": 0.8521037981953732, + "eval_num_tokens": 8028367.0, + "eval_runtime": 86.166, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.996, + "step": 3440 + }, + { + "entropy": 0.12040232736617326, + "epoch": 8.607721046077211, + "grad_norm": 0.3310582935810089, + "learning_rate": 1.3160380470927183e-05, + "loss": 0.06468871235847473, + "mean_token_accuracy": 0.9768650442361831, + "num_tokens": 8074934.0, + "step": 3460 + }, + { + "epoch": 8.607721046077211, + "eval_entropy": 0.24118655876711356, + "eval_loss": 0.9028318524360657, + "eval_mean_token_accuracy": 0.8521025340224422, + "eval_num_tokens": 8074934.0, + "eval_runtime": 85.3668, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.015, + "step": 3460 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.4093681551602074e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3480/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3480/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3480/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3480/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3480/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3480/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3480/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3480/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3480/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3480/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3480/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3480/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3480/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3480/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..5584241ec6b9c566311bb39a43f0b2889d3a405f --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3480/trainer_state.json @@ -0,0 +1,3688 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 8.657534246575342, + "eval_steps": 20, + "global_step": 3480, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + }, + { + "entropy": 0.561330484598875, + "epoch": 1.891656288916563, + "grad_norm": 0.6722865700721741, + "learning_rate": 0.0002208867897174789, + "loss": 0.499837589263916, + "mean_token_accuracy": 0.8518734864890576, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.5865232653396074, + "eval_loss": 0.5437926650047302, + "eval_mean_token_accuracy": 0.8450997017843779, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4116, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.547389242425561, + "epoch": 1.9414694894146949, + "grad_norm": 0.7935577034950256, + "learning_rate": 0.00022027119820226907, + "loss": 0.4977591514587402, + "mean_token_accuracy": 0.8539491161704064, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.5290903090391048, + "eval_loss": 0.5409526824951172, + "eval_mean_token_accuracy": 0.8497545698354411, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.7262, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 780 + }, + { + "entropy": 0.5687909748405218, + "epoch": 1.9912826899128269, + "grad_norm": 0.6180546283721924, + "learning_rate": 0.00021962329729698345, + "loss": 0.5109643459320068, + "mean_token_accuracy": 0.8521598495543004, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.5503541858390321, + "eval_loss": 0.5361555218696594, + "eval_mean_token_accuracy": 0.8510884285666221, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.3339, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 800 + }, + { + "entropy": 0.4739728841261986, + "epoch": 2.0398505603985058, + "grad_norm": 0.8058829307556152, + "learning_rate": 0.0002189432823996982, + "loss": 0.4204097747802734, + "mean_token_accuracy": 0.8728981889211215, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.5077334992414297, + "eval_loss": 0.5531114339828491, + "eval_mean_token_accuracy": 0.8489257208136625, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.4801, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.989, + "step": 820 + }, + { + "entropy": 0.4594309840351343, + "epoch": 2.0896637608966375, + "grad_norm": 0.6906896829605103, + "learning_rate": 0.0002182313585936314, + "loss": 0.4071959495544434, + "mean_token_accuracy": 0.8732857562601566, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.49850136994622474, + "eval_loss": 0.5486204624176025, + "eval_mean_token_accuracy": 0.8507991450470548, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.3364, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.4881629109382629, + "epoch": 2.1394769613947697, + "grad_norm": 0.6343470215797424, + "learning_rate": 0.0002174877405852928, + "loss": 0.41669540405273436, + "mean_token_accuracy": 0.8711295068264008, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.49155513924914734, + "eval_loss": 0.555109441280365, + "eval_mean_token_accuracy": 0.8496399400539176, + "eval_num_tokens": 2008562.0, + "eval_runtime": 86.3295, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 860 + }, + { + "entropy": 0.4648668970912695, + "epoch": 2.1892901618929015, + "grad_norm": 0.8014165163040161, + "learning_rate": 0.00021671265263973133, + "loss": 0.4110250473022461, + "mean_token_accuracy": 0.8754166305065155, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.4909258722219356, + "eval_loss": 0.5539511442184448, + "eval_mean_token_accuracy": 0.8492401502160138, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.3468, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 880 + }, + { + "entropy": 0.4824485514312983, + "epoch": 2.2391033623910337, + "grad_norm": 0.6665191054344177, + "learning_rate": 0.00021590632851289967, + "loss": 0.4181404113769531, + "mean_token_accuracy": 0.8726993151009083, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.4986876940657926, + "eval_loss": 0.547695517539978, + "eval_mean_token_accuracy": 0.8501384708770486, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.3838, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 900 + }, + { + "entropy": 0.4751896943897009, + "epoch": 2.2889165628891655, + "grad_norm": 0.81158047914505, + "learning_rate": 0.00021506901138115678, + "loss": 0.40689678192138673, + "mean_token_accuracy": 0.8745221219956875, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.507153491121392, + "eval_loss": 0.5501641631126404, + "eval_mean_token_accuracy": 0.8495670116918032, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.0912, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 920 + }, + { + "entropy": 0.4873133715242147, + "epoch": 2.3387297633872977, + "grad_norm": 0.7218056321144104, + "learning_rate": 0.0002142009537679292, + "loss": 0.42701358795166017, + "mean_token_accuracy": 0.8695114746689796, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5202612736543943, + "eval_loss": 0.5491839051246643, + "eval_mean_token_accuracy": 0.8494071208460386, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.1142, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 940 + }, + { + "entropy": 0.4762951169162989, + "epoch": 2.3885429638854294, + "grad_norm": 0.7194424867630005, + "learning_rate": 0.0002133024174675534, + "loss": 0.42299847602844237, + "mean_token_accuracy": 0.8709790132939815, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4899340462546016, + "eval_loss": 0.5522511601448059, + "eval_mean_token_accuracy": 0.8492208258357159, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.463, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 960 + }, + { + "entropy": 0.49650347977876663, + "epoch": 2.4383561643835616, + "grad_norm": 0.8406022787094116, + "learning_rate": 0.0002123736734663221, + "loss": 0.4275330066680908, + "mean_token_accuracy": 0.8670595556497573, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.49691385654515996, + "eval_loss": 0.5491269826889038, + "eval_mean_token_accuracy": 0.850309816210769, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.17, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 980 + }, + { + "entropy": 0.48843890577554705, + "epoch": 2.488169364881694, + "grad_norm": 0.9082473516464233, + "learning_rate": 0.00021141500186075868, + "loss": 0.4309722423553467, + "mean_token_accuracy": 0.8686766296625137, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5543508351195691, + "eval_loss": 0.5478800535202026, + "eval_mean_token_accuracy": 0.8478029522784921, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.3835, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 1000 + }, + { + "entropy": 0.4777219031006098, + "epoch": 2.5379825653798256, + "grad_norm": 0.7448089122772217, + "learning_rate": 0.0002104266917731438, + "loss": 0.423325252532959, + "mean_token_accuracy": 0.8706337086856365, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.49857561550168106, + "eval_loss": 0.5511948466300964, + "eval_mean_token_accuracy": 0.8502220289651737, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.5399, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.988, + "step": 1020 + }, + { + "entropy": 0.4844174191355705, + "epoch": 2.587795765877958, + "grad_norm": 0.794029176235199, + "learning_rate": 0.00020940904126432, + "loss": 0.4176753044128418, + "mean_token_accuracy": 0.873535567522049, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.485467542222766, + "eval_loss": 0.5539286732673645, + "eval_mean_token_accuracy": 0.8495475081510322, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.135, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 1.997, + "step": 1040 + }, + { + "entropy": 0.49070929251611234, + "epoch": 2.6376089663760895, + "grad_norm": 0.7558256983757019, + "learning_rate": 0.0002083623572438007, + "loss": 0.42867293357849123, + "mean_token_accuracy": 0.8696666076779366, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.490822730889154, + "eval_loss": 0.5434785485267639, + "eval_mean_token_accuracy": 0.850568296950917, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.4933, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 1060 + }, + { + "entropy": 0.47806114703416824, + "epoch": 2.6874221668742218, + "grad_norm": 0.6608979105949402, + "learning_rate": 0.00020728695537721047, + "loss": 0.4289727687835693, + "mean_token_accuracy": 0.8693130135536193, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.5285773256490397, + "eval_loss": 0.5444230437278748, + "eval_mean_token_accuracy": 0.8498796481032704, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.7091, + "eval_samples_per_second": 15.858, + "eval_steps_per_second": 1.984, + "step": 1080 + }, + { + "entropy": 0.5046216730028391, + "epoch": 2.7372353673723535, + "grad_norm": 0.8428544998168945, + "learning_rate": 0.00020618315999108454, + "loss": 0.43131070137023925, + "mean_token_accuracy": 0.8701941035687923, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.49888394738352576, + "eval_loss": 0.5459766387939453, + "eval_mean_token_accuracy": 0.8511758872935938, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.2222, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.995, + "step": 1100 + }, + { + "entropy": 0.5212558470666409, + "epoch": 2.7870485678704857, + "grad_norm": 1.129318118095398, + "learning_rate": 0.00020505130397505635, + "loss": 0.44249300956726073, + "mean_token_accuracy": 0.8654101334512234, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5179622324053631, + "eval_loss": 0.5522801280021667, + "eval_mean_token_accuracy": 0.8497019947268242, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.1903, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.996, + "step": 1120 + }, + { + "entropy": 0.4988406613469124, + "epoch": 2.8368617683686175, + "grad_norm": 0.6460545063018799, + "learning_rate": 0.00020389172868146263, + "loss": 0.4386270523071289, + "mean_token_accuracy": 0.8690383620560169, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.5042278484203094, + "eval_loss": 0.5433034300804138, + "eval_mean_token_accuracy": 0.8497674451317898, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.3028, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.993, + "step": 1140 + }, + { + "entropy": 0.4926559619605541, + "epoch": 2.8866749688667497, + "grad_norm": 0.8199329972267151, + "learning_rate": 0.00020270478382239615, + "loss": 0.4313485145568848, + "mean_token_accuracy": 0.8674727231264114, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.503873193160046, + "eval_loss": 0.5388111472129822, + "eval_mean_token_accuracy": 0.8526195034731266, + "eval_num_tokens": 2710196.0, + "eval_runtime": 86.4054, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.991, + "step": 1160 + }, + { + "entropy": 0.5020013231784105, + "epoch": 2.936488169364882, + "grad_norm": 0.7344821095466614, + "learning_rate": 0.00020149082736423723, + "loss": 0.43590536117553713, + "mean_token_accuracy": 0.8671772189438343, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5368241809828337, + "eval_loss": 0.5355703830718994, + "eval_mean_token_accuracy": 0.8517617773871089, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.2945, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1180 + }, + { + "entropy": 0.5112275708466768, + "epoch": 2.9863013698630136, + "grad_norm": 0.6951606869697571, + "learning_rate": 0.00020025022541969622, + "loss": 0.43579301834106443, + "mean_token_accuracy": 0.8641206480562686, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.5066795706055885, + "eval_loss": 0.5415249466896057, + "eval_mean_token_accuracy": 0.8493563373421513, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.5005, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.988, + "step": 1200 + }, + { + "entropy": 0.42298635305502474, + "epoch": 3.0348692403486925, + "grad_norm": 0.8201794028282166, + "learning_rate": 0.00019898335213739863, + "loss": 0.35593905448913576, + "mean_token_accuracy": 0.889238600547497, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.4584170470750609, + "eval_loss": 0.569487452507019, + "eval_mean_token_accuracy": 0.8495814173027526, + "eval_num_tokens": 2848509.0, + "eval_runtime": 86.2281, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 1220 + }, + { + "entropy": 0.37450140453875064, + "epoch": 3.0846824408468243, + "grad_norm": 0.7308394908905029, + "learning_rate": 0.0001976905895890471, + "loss": 0.307823920249939, + "mean_token_accuracy": 0.9001288741827012, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.45185995916294497, + "eval_loss": 0.5672881603240967, + "eval_mean_token_accuracy": 0.8511318519364955, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.0819, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.998, + "step": 1240 + }, + { + "entropy": 0.3887945845723152, + "epoch": 3.1344956413449565, + "grad_norm": 0.7299330830574036, + "learning_rate": 0.0001963723276541939, + "loss": 0.32047903537750244, + "mean_token_accuracy": 0.8960984498262405, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.44865354549053105, + "eval_loss": 0.5666037201881409, + "eval_mean_token_accuracy": 0.8496572649063066, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 1260 + }, + { + "entropy": 0.39677664265036583, + "epoch": 3.1843088418430883, + "grad_norm": 0.9533219933509827, + "learning_rate": 0.00019502896390265838, + "loss": 0.3253983497619629, + "mean_token_accuracy": 0.8964207418262958, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.4641980809527774, + "eval_loss": 0.5814996957778931, + "eval_mean_token_accuracy": 0.8485886212005171, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.7784, + "eval_samples_per_second": 15.845, + "eval_steps_per_second": 1.982, + "step": 1280 + }, + { + "entropy": 0.39210722744464876, + "epoch": 3.2341220423412205, + "grad_norm": 0.7447651028633118, + "learning_rate": 0.00019366090347462545, + "loss": 0.3276803970336914, + "mean_token_accuracy": 0.8930055953562259, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43595615254585135, + "eval_loss": 0.5722188353538513, + "eval_mean_token_accuracy": 0.8501105755567551, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.5271, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 1300 + }, + { + "entropy": 0.3684127271175385, + "epoch": 3.2839352428393527, + "grad_norm": 0.6934201121330261, + "learning_rate": 0.00019226855895846078, + "loss": 0.3156379222869873, + "mean_token_accuracy": 0.8976306475698947, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.4628148723480313, + "eval_loss": 0.5631352066993713, + "eval_mean_token_accuracy": 0.8504934813394103, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.3436, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 1320 + }, + { + "entropy": 0.4073401909321547, + "epoch": 3.3337484433374844, + "grad_norm": 0.9386897683143616, + "learning_rate": 0.00019085235026627994, + "loss": 0.34265310764312745, + "mean_token_accuracy": 0.8902062118053437, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.46455050623694133, + "eval_loss": 0.5586736798286438, + "eval_mean_token_accuracy": 0.8506874702004499, + "eval_num_tokens": 3132874.0, + "eval_runtime": 86.1286, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.997, + "step": 1340 + }, + { + "entropy": 0.4046429242938757, + "epoch": 3.383561643835616, + "grad_norm": 0.9633992314338684, + "learning_rate": 0.00018941270450730836, + "loss": 0.33816893100738527, + "mean_token_accuracy": 0.8927541889250279, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.46846531660750856, + "eval_loss": 0.561501681804657, + "eval_mean_token_accuracy": 0.8496256377114806, + "eval_num_tokens": 3178055.0, + "eval_runtime": 86.685, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1360 + }, + { + "entropy": 0.39872407019138334, + "epoch": 3.4333748443337484, + "grad_norm": 0.7786458730697632, + "learning_rate": 0.00018795005585907113, + "loss": 0.33342490196228025, + "mean_token_accuracy": 0.8944805048406124, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.42709505973860273, + "eval_loss": 0.5751848220825195, + "eval_mean_token_accuracy": 0.8507290447867194, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.6892, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 1380 + }, + { + "entropy": 0.3923338124528527, + "epoch": 3.4831880448318806, + "grad_norm": 0.9305956363677979, + "learning_rate": 0.0001864648454364511, + "loss": 0.33188116550445557, + "mean_token_accuracy": 0.8943330392241478, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.4386174779298694, + "eval_loss": 0.5680831074714661, + "eval_mean_token_accuracy": 0.8513129727784977, + "eval_num_tokens": 3274096.0, + "eval_runtime": 86.2671, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 1400 + }, + { + "entropy": 0.3856233984231949, + "epoch": 3.5330012453300124, + "grad_norm": 1.0362752676010132, + "learning_rate": 0.0001849575211586545, + "loss": 0.33098697662353516, + "mean_token_accuracy": 0.8961390435695649, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4574795474493226, + "eval_loss": 0.5630439519882202, + "eval_mean_token_accuracy": 0.8520988873964133, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.6035, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 1420 + }, + { + "entropy": 0.39812871962785723, + "epoch": 3.5828144458281446, + "grad_norm": 0.7807195782661438, + "learning_rate": 0.0001834285376141247, + "loss": 0.3333771228790283, + "mean_token_accuracy": 0.8930827379226685, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.4556825893909432, + "eval_loss": 0.5689062476158142, + "eval_mean_token_accuracy": 0.8507103507601937, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.1606, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.996, + "step": 1440 + }, + { + "entropy": 0.4147744856774807, + "epoch": 3.6326276463262763, + "grad_norm": 0.6429352164268494, + "learning_rate": 0.00018187835592344443, + "loss": 0.3482560873031616, + "mean_token_accuracy": 0.8910200245678425, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.46600024540757023, + "eval_loss": 0.5609709024429321, + "eval_mean_token_accuracy": 0.8491220876227977, + "eval_num_tokens": 3415600.0, + "eval_runtime": 86.8039, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1460 + }, + { + "entropy": 0.40425071083009245, + "epoch": 3.6824408468244085, + "grad_norm": 0.8613698482513428, + "learning_rate": 0.0001803074436002682, + "loss": 0.342916464805603, + "mean_token_accuracy": 0.8916418336331844, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.43855057899342026, + "eval_loss": 0.5720968246459961, + "eval_mean_token_accuracy": 0.8500823641932288, + "eval_num_tokens": 3460471.0, + "eval_runtime": 86.6746, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1480 + }, + { + "entropy": 0.39465143866837027, + "epoch": 3.7322540473225407, + "grad_norm": 0.6285189986228943, + "learning_rate": 0.0001787162744103265, + "loss": 0.3424591779708862, + "mean_token_accuracy": 0.8906558901071548, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4509461877304454, + "eval_loss": 0.5590082406997681, + "eval_mean_token_accuracy": 0.8511747371318729, + "eval_num_tokens": 3507647.0, + "eval_runtime": 86.8126, + "eval_samples_per_second": 15.839, + "eval_steps_per_second": 1.981, + "step": 1500 + }, + { + "entropy": 0.4021005939692259, + "epoch": 3.7820672478206725, + "grad_norm": 0.8821248412132263, + "learning_rate": 0.00017710532822854468, + "loss": 0.3462103843688965, + "mean_token_accuracy": 0.889109355956316, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.4502199075596277, + "eval_loss": 0.566046416759491, + "eval_mean_token_accuracy": 0.8501714208098345, + "eval_num_tokens": 3548934.0, + "eval_runtime": 86.8336, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.981, + "step": 1520 + }, + { + "entropy": 0.4017397932708263, + "epoch": 3.8318804483188043, + "grad_norm": 0.8400952816009521, + "learning_rate": 0.0001754750908943189, + "loss": 0.34890995025634763, + "mean_token_accuracy": 0.8892098367214203, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.4614003023435903, + "eval_loss": 0.5617933869361877, + "eval_mean_token_accuracy": 0.8515863616106122, + "eval_num_tokens": 3597186.0, + "eval_runtime": 86.4609, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 1540 + }, + { + "entropy": 0.4112051840871572, + "epoch": 3.8816936488169365, + "grad_norm": 0.769478440284729, + "learning_rate": 0.0001738260540649939, + "loss": 0.34711437225341796, + "mean_token_accuracy": 0.8911717928946018, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4540443811998811, + "eval_loss": 0.5576469898223877, + "eval_mean_token_accuracy": 0.8512079674144124, + "eval_num_tokens": 3646646.0, + "eval_runtime": 86.5103, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 1560 + }, + { + "entropy": 0.41105241514742374, + "epoch": 3.9315068493150687, + "grad_norm": 0.8468427062034607, + "learning_rate": 0.00017215871506758568, + "loss": 0.3433023452758789, + "mean_token_accuracy": 0.8898739732801915, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.4707539707075718, + "eval_loss": 0.5641466379165649, + "eval_mean_token_accuracy": 0.8495440957851188, + "eval_num_tokens": 3689560.0, + "eval_runtime": 86.609, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.986, + "step": 1580 + }, + { + "entropy": 0.41016379147768023, + "epoch": 3.9813200498132004, + "grad_norm": 0.7482675313949585, + "learning_rate": 0.0001704735767487946, + "loss": 0.34550890922546384, + "mean_token_accuracy": 0.8893028847873211, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.46391099864660307, + "eval_loss": 0.5593640804290771, + "eval_mean_token_accuracy": 0.8510130581467651, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.3975, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 1600 + }, + { + "entropy": 0.33167599791135544, + "epoch": 4.029887920298879, + "grad_norm": 0.9435692429542542, + "learning_rate": 0.00016877114732335337, + "loss": 0.2716026544570923, + "mean_token_accuracy": 0.9133149828666296, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.38499350005457567, + "eval_loss": 0.6298249363899231, + "eval_mean_token_accuracy": 0.8488117071778275, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.2933, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1620 + }, + { + "entropy": 0.3000166634097695, + "epoch": 4.0797011207970115, + "grad_norm": 0.8080845475196838, + "learning_rate": 0.0001670519402207569, + "loss": 0.22617182731628419, + "mean_token_accuracy": 0.9253474645316601, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.370110988703578, + "eval_loss": 0.6338461637496948, + "eval_mean_token_accuracy": 0.8485634801692741, + "eval_num_tokens": 3828830.0, + "eval_runtime": 85.9508, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.001, + "step": 1640 + }, + { + "entropy": 0.2986910421401262, + "epoch": 4.129514321295143, + "grad_norm": 0.7310900092124939, + "learning_rate": 0.0001653164739304185, + "loss": 0.22367463111877442, + "mean_token_accuracy": 0.9252275295555592, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.3944379702037157, + "eval_loss": 0.6109381914138794, + "eval_mean_token_accuracy": 0.849291454220927, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.6728, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1660 + }, + { + "entropy": 0.3095553796738386, + "epoch": 4.179327521793275, + "grad_norm": 0.7059140801429749, + "learning_rate": 0.0001635652718453007, + "loss": 0.23651680946350098, + "mean_token_accuracy": 0.9208931416273117, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.3910588648949945, + "eval_loss": 0.6104469299316406, + "eval_mean_token_accuracy": 0.8486883893262508, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7612, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.982, + "step": 1680 + }, + { + "entropy": 0.3001101028174162, + "epoch": 4.229140722291407, + "grad_norm": 0.6787802577018738, + "learning_rate": 0.00016179886210406728, + "loss": 0.23130471706390382, + "mean_token_accuracy": 0.9233332790434361, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3794369170832079, + "eval_loss": 0.6182110905647278, + "eval_mean_token_accuracy": 0.8495433777570724, + "eval_num_tokens": 3967474.0, + "eval_runtime": 85.94, + "eval_samples_per_second": 16.0, + "eval_steps_per_second": 2.001, + "step": 1700 + }, + { + "entropy": 0.3031421799212694, + "epoch": 4.2789539227895395, + "grad_norm": 0.9732038378715515, + "learning_rate": 0.0001600177774318036, + "loss": 0.2359529733657837, + "mean_token_accuracy": 0.9217648565769195, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3923123094231583, + "eval_loss": 0.6057384610176086, + "eval_mean_token_accuracy": 0.8508818288182103, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7647, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.29365369994193313, + "epoch": 4.328767123287671, + "grad_norm": 0.7681498527526855, + "learning_rate": 0.0001582225549793541, + "loss": 0.2269371747970581, + "mean_token_accuracy": 0.9245341829955578, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.4011661055129628, + "eval_loss": 0.6144486665725708, + "eval_mean_token_accuracy": 0.8480324357054955, + "eval_num_tokens": 4062594.0, + "eval_runtime": 87.1306, + "eval_samples_per_second": 15.781, + "eval_steps_per_second": 1.974, + "step": 1740 + }, + { + "entropy": 0.29396994728595016, + "epoch": 4.378580323785803, + "grad_norm": 1.0001007318496704, + "learning_rate": 0.0001564137361613248, + "loss": 0.22777395248413085, + "mean_token_accuracy": 0.9262309700250626, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38518730195802314, + "eval_loss": 0.6202630400657654, + "eval_mean_token_accuracy": 0.8493869807137999, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6616, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.3096018506214023, + "epoch": 4.428393524283935, + "grad_norm": 1.0448365211486816, + "learning_rate": 0.00015459186649280024, + "loss": 0.23696351051330566, + "mean_token_accuracy": 0.9217322513461113, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.3946371126140273, + "eval_loss": 0.6079026460647583, + "eval_mean_token_accuracy": 0.8492515852978063, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6582, + "eval_samples_per_second": 15.867, + "eval_steps_per_second": 1.985, + "step": 1780 + }, + { + "entropy": 0.32619857545942066, + "epoch": 4.478206724782067, + "grad_norm": 0.7210651636123657, + "learning_rate": 0.00015275749542482337, + "loss": 0.24651215076446534, + "mean_token_accuracy": 0.9177676141262054, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.3947690814560236, + "eval_loss": 0.6065912246704102, + "eval_mean_token_accuracy": 0.8502957744653835, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.5959, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.986, + "step": 1800 + }, + { + "entropy": 0.3193941755220294, + "epoch": 4.5280199252802, + "grad_norm": 0.8281906843185425, + "learning_rate": 0.0001509111761786888, + "loss": 0.23936262130737304, + "mean_token_accuracy": 0.9201708927750587, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38704028864239537, + "eval_loss": 0.6006569266319275, + "eval_mean_token_accuracy": 0.8502406720505205, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.8059, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1820 + }, + { + "entropy": 0.3164879363030195, + "epoch": 4.577833125778331, + "grad_norm": 0.7892968654632568, + "learning_rate": 0.00014905346557909867, + "loss": 0.24541733264923096, + "mean_token_accuracy": 0.9175932116806507, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.38861122120951497, + "eval_loss": 0.6115967631340027, + "eval_mean_token_accuracy": 0.849471275196519, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.2946, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1840 + }, + { + "entropy": 0.3051785985007882, + "epoch": 4.627646326276463, + "grad_norm": 0.8109654188156128, + "learning_rate": 0.0001471849238862319, + "loss": 0.23433220386505127, + "mean_token_accuracy": 0.9206570319831371, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.37162452295076015, + "eval_loss": 0.6184061765670776, + "eval_mean_token_accuracy": 0.8501173268223918, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.6865, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1860 + }, + { + "entropy": 0.3168198253959417, + "epoch": 4.677459526774595, + "grad_norm": 0.9512342214584351, + "learning_rate": 0.0001453061146267775, + "loss": 0.23832404613494873, + "mean_token_accuracy": 0.9197044663131237, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3845940856912801, + "eval_loss": 0.606762707233429, + "eval_mean_token_accuracy": 0.8504838194957999, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.5175, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 1880 + }, + { + "entropy": 0.30791807882487776, + "epoch": 4.7272727272727275, + "grad_norm": 0.8123113512992859, + "learning_rate": 0.00014341760442398248, + "loss": 0.2395785331726074, + "mean_token_accuracy": 0.918928150832653, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.39762327222283494, + "eval_loss": 0.5994202494621277, + "eval_mean_token_accuracy": 0.8509274201337681, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.2873, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.993, + "step": 1900 + }, + { + "entropy": 0.3021434534341097, + "epoch": 4.777085927770859, + "grad_norm": 0.731787383556366, + "learning_rate": 0.000141519962826766, + "loss": 0.23494718074798585, + "mean_token_accuracy": 0.9201403826475143, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.3827026732439219, + "eval_loss": 0.5995895862579346, + "eval_mean_token_accuracy": 0.851468373523202, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.3006, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 1920 + }, + { + "entropy": 0.31626159623265265, + "epoch": 4.826899128268991, + "grad_norm": 0.8848487138748169, + "learning_rate": 0.00013961376213795132, + "loss": 0.2439030647277832, + "mean_token_accuracy": 0.9196575872600079, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.388698436839636, + "eval_loss": 0.6000174283981323, + "eval_mean_token_accuracy": 0.8518068187458571, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.8979, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.979, + "step": 1940 + }, + { + "entropy": 0.30520407035946845, + "epoch": 4.876712328767123, + "grad_norm": 0.8532460927963257, + "learning_rate": 0.00013769957724166695, + "loss": 0.23458616733551024, + "mean_token_accuracy": 0.9221912942826748, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.38777847102908203, + "eval_loss": 0.6004981398582458, + "eval_mean_token_accuracy": 0.8516481768253238, + "eval_num_tokens": 4578167.0, + "eval_runtime": 87.0777, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.975, + "step": 1960 + }, + { + "entropy": 0.3226448342204094, + "epoch": 4.926525529265255, + "grad_norm": 0.6945561766624451, + "learning_rate": 0.0001357779854299694, + "loss": 0.24048397541046143, + "mean_token_accuracy": 0.9195300146937371, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.38581624263247777, + "eval_loss": 0.6029234528541565, + "eval_mean_token_accuracy": 0.8514213260523108, + "eval_num_tokens": 4622316.0, + "eval_runtime": 85.8729, + "eval_samples_per_second": 16.012, + "eval_steps_per_second": 2.003, + "step": 1980 + }, + { + "entropy": 0.3051655298098922, + "epoch": 4.976338729763388, + "grad_norm": 0.7976452708244324, + "learning_rate": 0.00013384956622874001, + "loss": 0.23584742546081544, + "mean_token_accuracy": 0.9216851457953453, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.37913159246361533, + "eval_loss": 0.6057604551315308, + "eval_mean_token_accuracy": 0.8525801203971686, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.1145, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 2000 + }, + { + "entropy": 0.27438195240803254, + "epoch": 5.024906600249066, + "grad_norm": 0.6729586124420166, + "learning_rate": 0.0001319149012229075, + "loss": 0.19775952100753785, + "mean_token_accuracy": 0.9339428559327737, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.3448961910813354, + "eval_loss": 0.6750120520591736, + "eval_mean_token_accuracy": 0.8487970232963562, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.1169, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 2020 + }, + { + "entropy": 0.21423916313797237, + "epoch": 5.074719800747198, + "grad_norm": 0.6934391856193542, + "learning_rate": 0.00012997457388105022, + "loss": 0.1439570426940918, + "mean_token_accuracy": 0.9528236843645572, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.3570949243771475, + "eval_loss": 0.6465504169464111, + "eval_mean_token_accuracy": 0.8490785547467166, + "eval_num_tokens": 4763269.0, + "eval_runtime": 85.9574, + "eval_samples_per_second": 15.996, + "eval_steps_per_second": 2.001, + "step": 2040 + }, + { + "entropy": 0.20838565267622472, + "epoch": 5.12453300124533, + "grad_norm": 0.7286986112594604, + "learning_rate": 0.00012802916937942972, + "loss": 0.14467307329177856, + "mean_token_accuracy": 0.950994835793972, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.3452463157821533, + "eval_loss": 0.6705958843231201, + "eval_mean_token_accuracy": 0.8490352796953778, + "eval_num_tokens": 4809047.0, + "eval_runtime": 86.228, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 2060 + }, + { + "entropy": 0.20453082229942082, + "epoch": 5.174346201743462, + "grad_norm": 0.7515555620193481, + "learning_rate": 0.00012607927442550974, + "loss": 0.13732000589370727, + "mean_token_accuracy": 0.9537357829511166, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.32431264914745506, + "eval_loss": 0.6743043065071106, + "eval_mean_token_accuracy": 0.8504878629085629, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.5948, + "eval_samples_per_second": 15.879, + "eval_steps_per_second": 1.986, + "step": 2080 + }, + { + "entropy": 0.21812320686876774, + "epoch": 5.224159402241594, + "grad_norm": 0.9093465209007263, + "learning_rate": 0.0001241254770810132, + "loss": 0.14311420917510986, + "mean_token_accuracy": 0.9514068141579628, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.33086285835435225, + "eval_loss": 0.6676449179649353, + "eval_mean_token_accuracy": 0.8505287662495015, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 2100 + }, + { + "entropy": 0.2180163251236081, + "epoch": 5.273972602739726, + "grad_norm": 0.6703007221221924, + "learning_rate": 0.00012216836658457075, + "loss": 0.14803968667984008, + "mean_token_accuracy": 0.9521303348243236, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.33162341708707255, + "eval_loss": 0.6658875942230225, + "eval_mean_token_accuracy": 0.8500757605530495, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.6296, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 2120 + }, + { + "entropy": 0.22511130161583423, + "epoch": 5.323785803237858, + "grad_norm": 0.8078880906105042, + "learning_rate": 0.00012020853317401455, + "loss": 0.15228408575057983, + "mean_token_accuracy": 0.947144789993763, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3354601170434508, + "eval_loss": 0.6677829623222351, + "eval_mean_token_accuracy": 0.8482600024273229, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.4689, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.989, + "step": 2140 + }, + { + "entropy": 0.2244176059961319, + "epoch": 5.37359900373599, + "grad_norm": 0.9636075496673584, + "learning_rate": 0.00011824656790837037, + "loss": 0.15260883569717407, + "mean_token_accuracy": 0.9471467643976211, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.3381616926297199, + "eval_loss": 0.6694412231445312, + "eval_mean_token_accuracy": 0.8482369603805764, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.4147, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 2160 + }, + { + "entropy": 0.22982364390045404, + "epoch": 5.423412204234122, + "grad_norm": 0.775401771068573, + "learning_rate": 0.00011628306248960262, + "loss": 0.15140302181243898, + "mean_token_accuracy": 0.9492553934454918, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.3305150235808173, + "eval_loss": 0.6717822551727295, + "eval_mean_token_accuracy": 0.8489849723355715, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.4728, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.989, + "step": 2180 + }, + { + "entropy": 0.21448935717344284, + "epoch": 5.473225404732254, + "grad_norm": 0.6575281023979187, + "learning_rate": 0.00011431860908416465, + "loss": 0.1452319622039795, + "mean_token_accuracy": 0.9505287684500218, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3488145174328671, + "eval_loss": 0.6612305641174316, + "eval_mean_token_accuracy": 0.8492907808963642, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6927, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 2200 + }, + { + "entropy": 0.23091202937066554, + "epoch": 5.523038605230386, + "grad_norm": 0.8909686207771301, + "learning_rate": 0.00011235380014440985, + "loss": 0.15150139331817628, + "mean_token_accuracy": 0.9497875183820724, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.3268539015810157, + "eval_loss": 0.6667542457580566, + "eval_mean_token_accuracy": 0.8499062903398691, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.4644, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 2220 + }, + { + "entropy": 0.2227974807843566, + "epoch": 5.572851805728518, + "grad_norm": 0.6180275082588196, + "learning_rate": 0.0001103892282299158, + "loss": 0.1491069197654724, + "mean_token_accuracy": 0.9488144010305405, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3346347655494546, + "eval_loss": 0.6665948629379272, + "eval_mean_token_accuracy": 0.8499961893918903, + "eval_num_tokens": 5226864.0, + "eval_runtime": 87.0548, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.976, + "step": 2240 + }, + { + "entropy": 0.21368421968072654, + "epoch": 5.62266500622665, + "grad_norm": 0.6004369258880615, + "learning_rate": 0.00010842548582877651, + "loss": 0.14485255479812623, + "mean_token_accuracy": 0.9502056457102299, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.32753298804163933, + "eval_loss": 0.6680151224136353, + "eval_mean_token_accuracy": 0.8515451086121936, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.8524, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.98, + "step": 2260 + }, + { + "entropy": 0.2103635374456644, + "epoch": 5.672478206724782, + "grad_norm": 0.699174702167511, + "learning_rate": 0.00010646316517891613, + "loss": 0.14297772645950318, + "mean_token_accuracy": 0.9512537539005279, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.32966585959806, + "eval_loss": 0.675578773021698, + "eval_mean_token_accuracy": 0.8509623023659684, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.4518, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.99, + "step": 2280 + }, + { + "entropy": 0.22516900151968003, + "epoch": 5.722291407222914, + "grad_norm": 0.6637354493141174, + "learning_rate": 0.00010450285808947797, + "loss": 0.15202572345733642, + "mean_token_accuracy": 0.9482452072203159, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3369456917740578, + "eval_loss": 0.6697061061859131, + "eval_mean_token_accuracy": 0.848603522361711, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.6371, + "eval_samples_per_second": 15.871, + "eval_steps_per_second": 1.985, + "step": 2300 + }, + { + "entropy": 0.21841065725311637, + "epoch": 5.772104607721046, + "grad_norm": 0.7940268516540527, + "learning_rate": 0.00010254515576234297, + "loss": 0.14710167646408082, + "mean_token_accuracy": 0.9493498183786869, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3237486180177955, + "eval_loss": 0.6779657602310181, + "eval_mean_token_accuracy": 0.8500715313955794, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.1826, + "eval_samples_per_second": 15.954, + "eval_steps_per_second": 1.996, + "step": 2320 + }, + { + "entropy": 0.22146204356104135, + "epoch": 5.821917808219178, + "grad_norm": 0.9234833121299744, + "learning_rate": 0.00010059064861383132, + "loss": 0.14720046520233154, + "mean_token_accuracy": 0.9493872679769992, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.32365207564692167, + "eval_loss": 0.6704005002975464, + "eval_mean_token_accuracy": 0.8507985760306203, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.5494, + "eval_samples_per_second": 15.887, + "eval_steps_per_second": 1.987, + "step": 2340 + }, + { + "entropy": 0.20934011954814197, + "epoch": 5.87173100871731, + "grad_norm": 0.5547503232955933, + "learning_rate": 9.863992609664084e-05, + "loss": 0.1464867353439331, + "mean_token_accuracy": 0.9503875687718392, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.3330401429083458, + "eval_loss": 0.6659091114997864, + "eval_mean_token_accuracy": 0.8504848906467127, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.5855, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 2360 + }, + { + "entropy": 0.21678635366261007, + "epoch": 5.921544209215442, + "grad_norm": 0.570612907409668, + "learning_rate": 9.669357652207635e-05, + "loss": 0.14821385145187377, + "mean_token_accuracy": 0.9503940217196941, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3322022325077722, + "eval_loss": 0.6722489595413208, + "eval_mean_token_accuracy": 0.8489979422369669, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.2986, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 2380 + }, + { + "entropy": 0.20932920072227718, + "epoch": 5.971357409713574, + "grad_norm": 0.7879557609558105, + "learning_rate": 9.475218688262262e-05, + "loss": 0.14675841331481934, + "mean_token_accuracy": 0.9507176131010056, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.3199348642902319, + "eval_loss": 0.6698136329650879, + "eval_mean_token_accuracy": 0.8514142130003419, + "eval_num_tokens": 5605400.0, + "eval_runtime": 85.8995, + "eval_samples_per_second": 16.007, + "eval_steps_per_second": 2.002, + "step": 2400 + }, + { + "entropy": 0.21032143919131693, + "epoch": 6.019925280199253, + "grad_norm": 0.5823076367378235, + "learning_rate": 9.281634267491569e-05, + "loss": 0.13322267532348633, + "mean_token_accuracy": 0.9550939072401096, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.30206270117399303, + "eval_loss": 0.7093168497085571, + "eval_mean_token_accuracy": 0.8500627639681794, + "eval_num_tokens": 5648968.0, + "eval_runtime": 85.8128, + "eval_samples_per_second": 16.023, + "eval_steps_per_second": 2.004, + "step": 2420 + }, + { + "entropy": 0.1534628233872354, + "epoch": 6.069738480697385, + "grad_norm": 0.710133969783783, + "learning_rate": 9.088662772316508e-05, + "loss": 0.09078952670097351, + "mean_token_accuracy": 0.9678447999060154, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.28208133101809857, + "eval_loss": 0.7636417150497437, + "eval_mean_token_accuracy": 0.8494061477655588, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9724, + "eval_samples_per_second": 15.994, + "eval_steps_per_second": 2.001, + "step": 2440 + }, + { + "entropy": 0.16151462448760867, + "epoch": 6.119551681195516, + "grad_norm": 0.5793812274932861, + "learning_rate": 8.896362400308028e-05, + "loss": 0.09545697569847107, + "mean_token_accuracy": 0.9671573750674725, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.2833245605403601, + "eval_loss": 0.7402405738830566, + "eval_mean_token_accuracy": 0.8503523728875226, + "eval_num_tokens": 5745090.0, + "eval_runtime": 85.5461, + "eval_samples_per_second": 16.073, + "eval_steps_per_second": 2.011, + "step": 2460 + }, + { + "entropy": 0.15203177919611335, + "epoch": 6.169364881693649, + "grad_norm": 0.4251123368740082, + "learning_rate": 8.704791146635483e-05, + "loss": 0.09420782327651978, + "mean_token_accuracy": 0.9677386932075024, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.28572545962971313, + "eval_loss": 0.735416829586029, + "eval_mean_token_accuracy": 0.8487084663884584, + "eval_num_tokens": 5790333.0, + "eval_runtime": 85.4801, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.012, + "step": 2480 + }, + { + "entropy": 0.15587336672469973, + "epoch": 6.219178082191781, + "grad_norm": 0.4357028007507324, + "learning_rate": 8.514006786576085e-05, + "loss": 0.09429320096969604, + "mean_token_accuracy": 0.9682952925562859, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.2859006894882335, + "eval_loss": 0.7347224950790405, + "eval_mean_token_accuracy": 0.8501905518215757, + "eval_num_tokens": 5837321.0, + "eval_runtime": 85.7578, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.006, + "step": 2500 + }, + { + "entropy": 0.15765639198943973, + "epoch": 6.268991282689913, + "grad_norm": 0.47331130504608154, + "learning_rate": 8.324066858090663e-05, + "loss": 0.09571113586425781, + "mean_token_accuracy": 0.9683481335639954, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.29231513846059176, + "eval_loss": 0.7392512559890747, + "eval_mean_token_accuracy": 0.8486633983462356, + "eval_num_tokens": 5884398.0, + "eval_runtime": 85.7846, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.005, + "step": 2520 + }, + { + "entropy": 0.16176860257983208, + "epoch": 6.318804483188045, + "grad_norm": 0.6142018437385559, + "learning_rate": 8.135028644470992e-05, + "loss": 0.09486144185066223, + "mean_token_accuracy": 0.9682316601276397, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.2851274753379267, + "eval_loss": 0.7520816922187805, + "eval_mean_token_accuracy": 0.8501113649717597, + "eval_num_tokens": 5929876.0, + "eval_runtime": 85.9425, + "eval_samples_per_second": 15.999, + "eval_steps_per_second": 2.001, + "step": 2540 + }, + { + "entropy": 0.15404034564271568, + "epoch": 6.3686176836861765, + "grad_norm": 0.6051287651062012, + "learning_rate": 7.946949157063964e-05, + "loss": 0.09280472993850708, + "mean_token_accuracy": 0.9684635892510414, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28802703563557114, + "eval_loss": 0.7439162135124207, + "eval_mean_token_accuracy": 0.8499851770872293, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.0703, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.998, + "step": 2560 + }, + { + "entropy": 0.15343588953837753, + "epoch": 6.418430884184309, + "grad_norm": 0.4823743402957916, + "learning_rate": 7.759885118077701e-05, + "loss": 0.09000591039657593, + "mean_token_accuracy": 0.9699928767979145, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2795634938533916, + "eval_loss": 0.7647850513458252, + "eval_mean_token_accuracy": 0.8503464397995971, + "eval_num_tokens": 6025380.0, + "eval_runtime": 85.8886, + "eval_samples_per_second": 16.009, + "eval_steps_per_second": 2.003, + "step": 2580 + }, + { + "entropy": 0.15740026142448188, + "epoch": 6.468244084682441, + "grad_norm": 0.5082696676254272, + "learning_rate": 7.57389294347494e-05, + "loss": 0.09191849827766418, + "mean_token_accuracy": 0.9692809768021107, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2913342311458532, + "eval_loss": 0.7518694996833801, + "eval_mean_token_accuracy": 0.8483168302580367, + "eval_num_tokens": 6073349.0, + "eval_runtime": 85.5761, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.01, + "step": 2600 + }, + { + "entropy": 0.15922069251537324, + "epoch": 6.518057285180573, + "grad_norm": 0.3995199501514435, + "learning_rate": 7.389028725958736e-05, + "loss": 0.09584367871284485, + "mean_token_accuracy": 0.9685114495456218, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.2863075934177221, + "eval_loss": 0.7539381384849548, + "eval_mean_token_accuracy": 0.8507507083027862, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.112, + "eval_samples_per_second": 15.968, + "eval_steps_per_second": 1.997, + "step": 2620 + }, + { + "entropy": 0.16197575423866512, + "epoch": 6.567870485678705, + "grad_norm": 0.534295380115509, + "learning_rate": 7.205348218055678e-05, + "loss": 0.0961170256137848, + "mean_token_accuracy": 0.9674530044198036, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.29021967315050057, + "eval_loss": 0.751198947429657, + "eval_mean_token_accuracy": 0.8509796344956686, + "eval_num_tokens": 6165523.0, + "eval_runtime": 85.7958, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.005, + "step": 2640 + }, + { + "entropy": 0.15261746793985367, + "epoch": 6.617683686176837, + "grad_norm": 0.5391237139701843, + "learning_rate": 7.022906815301673e-05, + "loss": 0.0926026999950409, + "mean_token_accuracy": 0.9695659473538398, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.29128045216202736, + "eval_loss": 0.7450292110443115, + "eval_mean_token_accuracy": 0.8498771443616512, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.3963, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 2660 + }, + { + "entropy": 0.16164180357009172, + "epoch": 6.667496886674969, + "grad_norm": 0.5767946243286133, + "learning_rate": 6.841759539535419e-05, + "loss": 0.09291981458663941, + "mean_token_accuracy": 0.9687136687338352, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2897637223088464, + "eval_loss": 0.7503410577774048, + "eval_mean_token_accuracy": 0.8503315164599308, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.0653, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.998, + "step": 2680 + }, + { + "entropy": 0.17062523355707526, + "epoch": 6.717310087173101, + "grad_norm": 0.4974168539047241, + "learning_rate": 6.661961022304563e-05, + "loss": 0.09713236689567566, + "mean_token_accuracy": 0.9661971725523472, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2765843396963075, + "eval_loss": 0.7604002356529236, + "eval_mean_token_accuracy": 0.8521115277395692, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.1676, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 2700 + }, + { + "entropy": 0.17544092936441302, + "epoch": 6.767123287671232, + "grad_norm": 0.5523537993431091, + "learning_rate": 6.483565488389582e-05, + "loss": 0.09709116220474243, + "mean_token_accuracy": 0.9650957375764847, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.27939334659035814, + "eval_loss": 0.7534670829772949, + "eval_mean_token_accuracy": 0.851230604010959, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.2913, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 2720 + }, + { + "entropy": 0.15991022661328316, + "epoch": 6.816936488169365, + "grad_norm": 0.478551983833313, + "learning_rate": 6.306626739450311e-05, + "loss": 0.09564646482467651, + "mean_token_accuracy": 0.9679084822535515, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.27878295491601146, + "eval_loss": 0.7519959211349487, + "eval_mean_token_accuracy": 0.8510654949864676, + "eval_num_tokens": 6397720.0, + "eval_runtime": 85.9109, + "eval_samples_per_second": 16.005, + "eval_steps_per_second": 2.002, + "step": 2740 + }, + { + "entropy": 0.16824879590421915, + "epoch": 6.866749688667497, + "grad_norm": 0.6681098937988281, + "learning_rate": 6.131198137800108e-05, + "loss": 0.0962279736995697, + "mean_token_accuracy": 0.966830012947321, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.2834690434121808, + "eval_loss": 0.751922070980072, + "eval_mean_token_accuracy": 0.8521237577809844, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.3618, + "eval_samples_per_second": 15.921, + "eval_steps_per_second": 1.992, + "step": 2760 + }, + { + "entropy": 0.1518704930320382, + "epoch": 6.916562889165629, + "grad_norm": 0.5201290249824524, + "learning_rate": 5.957332590312513e-05, + "loss": 0.09010660648345947, + "mean_token_accuracy": 0.9693463340401649, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.28485129617674404, + "eval_loss": 0.7452457547187805, + "eval_mean_token_accuracy": 0.8512036796919135, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.4524, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.99, + "step": 2780 + }, + { + "entropy": 0.15512610590085388, + "epoch": 6.966376089663761, + "grad_norm": 0.42802050709724426, + "learning_rate": 5.785082532465233e-05, + "loss": 0.09320432543754578, + "mean_token_accuracy": 0.9686134628951549, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.27554594526110693, + "eval_loss": 0.7644653916358948, + "eval_mean_token_accuracy": 0.8513738523389018, + "eval_num_tokens": 6540175.0, + "eval_runtime": 85.7609, + "eval_samples_per_second": 16.033, + "eval_steps_per_second": 2.006, + "step": 2800 + }, + { + "entropy": 0.17524497526196334, + "epoch": 7.01494396014944, + "grad_norm": 0.3330269157886505, + "learning_rate": 5.6144999125263545e-05, + "loss": 0.0895616888999939, + "mean_token_accuracy": 0.9682766932707566, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.2735865569218647, + "eval_loss": 0.768479585647583, + "eval_mean_token_accuracy": 0.8503459383581959, + "eval_num_tokens": 6583767.0, + "eval_runtime": 85.7162, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.007, + "step": 2820 + }, + { + "entropy": 0.1403565663844347, + "epoch": 7.064757160647572, + "grad_norm": 0.35613498091697693, + "learning_rate": 5.4456361758874235e-05, + "loss": 0.07551313638687134, + "mean_token_accuracy": 0.9739301167428493, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.25941789089593775, + "eval_loss": 0.8209511637687683, + "eval_mean_token_accuracy": 0.8505055855873019, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.0943, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 2840 + }, + { + "entropy": 0.13500106502324344, + "epoch": 7.114570361145703, + "grad_norm": 0.34418627619743347, + "learning_rate": 5.2785422495482234e-05, + "loss": 0.07293946146965027, + "mean_token_accuracy": 0.9747208289802074, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.26482899772912954, + "eval_loss": 0.798904538154602, + "eval_mean_token_accuracy": 0.8511530233677044, + "eval_num_tokens": 6672946.0, + "eval_runtime": 85.7915, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.005, + "step": 2860 + }, + { + "entropy": 0.13127502552233636, + "epoch": 7.164383561643835, + "grad_norm": 0.4638441503047943, + "learning_rate": 5.113268526757892e-05, + "loss": 0.07121461629867554, + "mean_token_accuracy": 0.9756786689162255, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2645381211714689, + "eval_loss": 0.809101939201355, + "eval_mean_token_accuracy": 0.8514727898115335, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.84, + "eval_samples_per_second": 16.018, + "eval_steps_per_second": 2.004, + "step": 2880 + }, + { + "entropy": 0.1331390908919275, + "epoch": 7.214196762141968, + "grad_norm": 0.40206775069236755, + "learning_rate": 4.949864851817007e-05, + "loss": 0.07188264131546021, + "mean_token_accuracy": 0.9755406074225903, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.26244733283339544, + "eval_loss": 0.8143188953399658, + "eval_mean_token_accuracy": 0.8514358189909957, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.8546, + "eval_samples_per_second": 16.015, + "eval_steps_per_second": 2.003, + "step": 2900 + }, + { + "entropy": 0.13647331558167936, + "epoch": 7.2640099626401, + "grad_norm": 0.26405787467956543, + "learning_rate": 4.788380505045224e-05, + "loss": 0.07412450313568116, + "mean_token_accuracy": 0.9744274213910102, + "num_tokens": 6809678.0, + "step": 2920 + }, + { + "epoch": 7.2640099626401, + "eval_entropy": 0.2626111418182074, + "eval_loss": 0.8111525177955627, + "eval_mean_token_accuracy": 0.8512121695418691, + "eval_num_tokens": 6809678.0, + "eval_runtime": 85.9626, + "eval_samples_per_second": 15.995, + "eval_steps_per_second": 2.001, + "step": 2920 + }, + { + "entropy": 0.12644002586603165, + "epoch": 7.313823163138232, + "grad_norm": 0.27514681220054626, + "learning_rate": 4.6288641879189884e-05, + "loss": 0.06807711124420165, + "mean_token_accuracy": 0.9760703906416893, + "num_tokens": 6860750.0, + "step": 2940 + }, + { + "epoch": 7.313823163138232, + "eval_entropy": 0.26096762734097106, + "eval_loss": 0.8184595108032227, + "eval_mean_token_accuracy": 0.8501476153384807, + "eval_num_tokens": 6860750.0, + "eval_runtime": 85.9521, + "eval_samples_per_second": 15.997, + "eval_steps_per_second": 2.001, + "step": 2940 + }, + { + "entropy": 0.13920630998909472, + "epoch": 7.363636363636363, + "grad_norm": 0.23584705591201782, + "learning_rate": 4.4713640083838604e-05, + "loss": 0.07301607131958007, + "mean_token_accuracy": 0.9745715200901032, + "num_tokens": 6907092.0, + "step": 2960 + }, + { + "epoch": 7.363636363636363, + "eval_entropy": 0.2612536767021168, + "eval_loss": 0.8116245269775391, + "eval_mean_token_accuracy": 0.8510967350976412, + "eval_num_tokens": 6907092.0, + "eval_runtime": 85.6373, + "eval_samples_per_second": 16.056, + "eval_steps_per_second": 2.008, + "step": 2960 + }, + { + "entropy": 0.1349492883309722, + "epoch": 7.4134495641344955, + "grad_norm": 0.24552719295024872, + "learning_rate": 4.315927466345791e-05, + "loss": 0.07397544980049134, + "mean_token_accuracy": 0.9745095103979111, + "num_tokens": 6952700.0, + "step": 2980 + }, + { + "epoch": 7.4134495641344955, + "eval_entropy": 0.25796533306670744, + "eval_loss": 0.8266491293907166, + "eval_mean_token_accuracy": 0.8511653857868772, + "eval_num_tokens": 6952700.0, + "eval_runtime": 85.7462, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.006, + "step": 2980 + }, + { + "entropy": 0.14479175000451505, + "epoch": 7.463262764632628, + "grad_norm": 0.2846072018146515, + "learning_rate": 4.162601439345814e-05, + "loss": 0.07544798254966736, + "mean_token_accuracy": 0.9727819666266442, + "num_tokens": 6996430.0, + "step": 3000 + }, + { + "epoch": 7.463262764632628, + "eval_entropy": 0.2584348309698493, + "eval_loss": 0.8253348469734192, + "eval_mean_token_accuracy": 0.8511569815319638, + "eval_num_tokens": 6996430.0, + "eval_runtime": 86.2984, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 3000 + }, + { + "entropy": 0.14114196319133043, + "epoch": 7.51307596513076, + "grad_norm": 0.407966285943985, + "learning_rate": 4.011432168422419e-05, + "loss": 0.0736398994922638, + "mean_token_accuracy": 0.9741654269397259, + "num_tokens": 7042038.0, + "step": 3020 + }, + { + "epoch": 7.51307596513076, + "eval_entropy": 0.25232676260693127, + "eval_loss": 0.8296052813529968, + "eval_mean_token_accuracy": 0.8523298349491385, + "eval_num_tokens": 7042038.0, + "eval_runtime": 85.8445, + "eval_samples_per_second": 16.017, + "eval_steps_per_second": 2.004, + "step": 3020 + }, + { + "entropy": 0.1353456223383546, + "epoch": 7.562889165628892, + "grad_norm": 0.2712634801864624, + "learning_rate": 3.8624652441658684e-05, + "loss": 0.07362412214279175, + "mean_token_accuracy": 0.9747945807874203, + "num_tokens": 7089390.0, + "step": 3040 + }, + { + "epoch": 7.562889165628892, + "eval_entropy": 0.2579477243991785, + "eval_loss": 0.8274564743041992, + "eval_mean_token_accuracy": 0.8517705212498821, + "eval_num_tokens": 7089390.0, + "eval_runtime": 85.8222, + "eval_samples_per_second": 16.022, + "eval_steps_per_second": 2.004, + "step": 3040 + }, + { + "entropy": 0.1296080862637609, + "epoch": 7.6127023661270234, + "grad_norm": 0.2371893972158432, + "learning_rate": 3.715745592968707e-05, + "loss": 0.06971035599708557, + "mean_token_accuracy": 0.9759043246507645, + "num_tokens": 7138002.0, + "step": 3060 + }, + { + "epoch": 7.6127023661270234, + "eval_entropy": 0.25391967083479083, + "eval_loss": 0.8197130560874939, + "eval_mean_token_accuracy": 0.8522267875283264, + "eval_num_tokens": 7138002.0, + "eval_runtime": 85.8796, + "eval_samples_per_second": 16.011, + "eval_steps_per_second": 2.003, + "step": 3060 + }, + { + "entropy": 0.1311203008517623, + "epoch": 7.662515566625156, + "grad_norm": 0.22499267756938934, + "learning_rate": 3.5713174634765967e-05, + "loss": 0.07176244258880615, + "mean_token_accuracy": 0.9754939571022987, + "num_tokens": 7185520.0, + "step": 3080 + }, + { + "epoch": 7.662515566625156, + "eval_entropy": 0.2526215241225653, + "eval_loss": 0.8265154361724854, + "eval_mean_token_accuracy": 0.8519952584837758, + "eval_num_tokens": 7185520.0, + "eval_runtime": 85.8746, + "eval_samples_per_second": 16.012, + "eval_steps_per_second": 2.003, + "step": 3080 + }, + { + "entropy": 0.13420484317466616, + "epoch": 7.712328767123288, + "grad_norm": 0.2398064285516739, + "learning_rate": 3.4292244132434866e-05, + "loss": 0.07559212446212768, + "mean_token_accuracy": 0.9743142127990723, + "num_tokens": 7232170.0, + "step": 3100 + }, + { + "epoch": 7.712328767123288, + "eval_entropy": 0.2484562756537005, + "eval_loss": 0.8312150239944458, + "eval_mean_token_accuracy": 0.8528405119513356, + "eval_num_tokens": 7232170.0, + "eval_runtime": 85.7896, + "eval_samples_per_second": 16.028, + "eval_steps_per_second": 2.005, + "step": 3100 + }, + { + "entropy": 0.11965563679113984, + "epoch": 7.76214196762142, + "grad_norm": 0.3408384919166565, + "learning_rate": 3.2895092955952746e-05, + "loss": 0.0661750853061676, + "mean_token_accuracy": 0.9776600524783134, + "num_tokens": 7282846.0, + "step": 3120 + }, + { + "epoch": 7.76214196762142, + "eval_entropy": 0.2522421533804993, + "eval_loss": 0.8327009677886963, + "eval_mean_token_accuracy": 0.8524222023958383, + "eval_num_tokens": 7282846.0, + "eval_runtime": 86.1769, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 1.996, + "step": 3120 + }, + { + "entropy": 0.13388084415346385, + "epoch": 7.811955168119551, + "grad_norm": 0.35418516397476196, + "learning_rate": 3.152214246705829e-05, + "loss": 0.07149899601936341, + "mean_token_accuracy": 0.9747635535895824, + "num_tokens": 7331518.0, + "step": 3140 + }, + { + "epoch": 7.811955168119551, + "eval_entropy": 0.25038352296795957, + "eval_loss": 0.836457371711731, + "eval_mean_token_accuracy": 0.8526130665180295, + "eval_num_tokens": 7331518.0, + "eval_runtime": 85.6099, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.009, + "step": 3140 + }, + { + "entropy": 0.13530643959529698, + "epoch": 7.861768368617684, + "grad_norm": 0.38060539960861206, + "learning_rate": 3.017380672889291e-05, + "loss": 0.07116585969924927, + "mean_token_accuracy": 0.973284512758255, + "num_tokens": 7379056.0, + "step": 3160 + }, + { + "epoch": 7.861768368617684, + "eval_entropy": 0.255092611319797, + "eval_loss": 0.8314701914787292, + "eval_mean_token_accuracy": 0.8520913099826768, + "eval_num_tokens": 7379056.0, + "eval_runtime": 85.877, + "eval_samples_per_second": 16.011, + "eval_steps_per_second": 2.003, + "step": 3160 + }, + { + "entropy": 0.13383390177041293, + "epoch": 7.911581569115816, + "grad_norm": 0.3827536106109619, + "learning_rate": 2.8850492381124808e-05, + "loss": 0.07305437326431274, + "mean_token_accuracy": 0.9750778004527092, + "num_tokens": 7424770.0, + "step": 3180 + }, + { + "epoch": 7.911581569115816, + "eval_entropy": 0.25416371157003004, + "eval_loss": 0.8206402063369751, + "eval_mean_token_accuracy": 0.852779901651449, + "eval_num_tokens": 7424770.0, + "eval_runtime": 86.1015, + "eval_samples_per_second": 15.97, + "eval_steps_per_second": 1.998, + "step": 3180 + }, + { + "entropy": 0.1395680439658463, + "epoch": 7.961394769613948, + "grad_norm": 0.3809775412082672, + "learning_rate": 2.7552598517312256e-05, + "loss": 0.07236042022705078, + "mean_token_accuracy": 0.9731538116931915, + "num_tokens": 7470804.0, + "step": 3200 + }, + { + "epoch": 7.961394769613948, + "eval_entropy": 0.25528111975899964, + "eval_loss": 0.8230037093162537, + "eval_mean_token_accuracy": 0.8526452603035195, + "eval_num_tokens": 7470804.0, + "eval_runtime": 85.7895, + "eval_samples_per_second": 16.028, + "eval_steps_per_second": 2.005, + "step": 3200 + }, + { + "entropy": 0.12193699864049752, + "epoch": 8.009962640099626, + "grad_norm": 0.11854425817728043, + "learning_rate": 2.6280516564542205e-05, + "loss": 0.06617764234542847, + "mean_token_accuracy": 0.977179691577569, + "num_tokens": 7518110.0, + "step": 3220 + }, + { + "epoch": 8.009962640099626, + "eval_entropy": 0.25100527677771656, + "eval_loss": 0.8393343687057495, + "eval_mean_token_accuracy": 0.8522553132023922, + "eval_num_tokens": 7518110.0, + "eval_runtime": 85.8837, + "eval_samples_per_second": 16.01, + "eval_steps_per_second": 2.003, + "step": 3220 + }, + { + "entropy": 0.12788885813206435, + "epoch": 8.059775840597759, + "grad_norm": 0.16094881296157837, + "learning_rate": 2.50346301653812e-05, + "loss": 0.06274186968803405, + "mean_token_accuracy": 0.9766994707286358, + "num_tokens": 7565539.0, + "step": 3240 + }, + { + "epoch": 8.059775840597759, + "eval_entropy": 0.24409458682287571, + "eval_loss": 0.874617338180542, + "eval_mean_token_accuracy": 0.8521041180505309, + "eval_num_tokens": 7565539.0, + "eval_runtime": 86.2656, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 3240 + }, + { + "entropy": 0.12464155335910618, + "epoch": 8.10958904109589, + "grad_norm": 0.16893954575061798, + "learning_rate": 2.381531506217437e-05, + "loss": 0.06093020439147949, + "mean_token_accuracy": 0.9776258453726768, + "num_tokens": 7612578.0, + "step": 3260 + }, + { + "epoch": 8.10958904109589, + "eval_entropy": 0.24396493017326953, + "eval_loss": 0.891161322593689, + "eval_mean_token_accuracy": 0.8515338024427724, + "eval_num_tokens": 7612578.0, + "eval_runtime": 85.9061, + "eval_samples_per_second": 16.006, + "eval_steps_per_second": 2.002, + "step": 3260 + }, + { + "entropy": 0.12345920228399336, + "epoch": 8.159402241594023, + "grad_norm": 0.14332273602485657, + "learning_rate": 2.262293898372616e-05, + "loss": 0.061289966106414795, + "mean_token_accuracy": 0.9762230902910233, + "num_tokens": 7660157.0, + "step": 3280 + }, + { + "epoch": 8.159402241594023, + "eval_entropy": 0.2481445314059424, + "eval_loss": 0.8922848105430603, + "eval_mean_token_accuracy": 0.8514944855556932, + "eval_num_tokens": 7660157.0, + "eval_runtime": 85.5201, + "eval_samples_per_second": 16.078, + "eval_steps_per_second": 2.011, + "step": 3280 + }, + { + "entropy": 0.12298110066913068, + "epoch": 8.209215442092155, + "grad_norm": 0.21848882734775543, + "learning_rate": 2.1457861534398633e-05, + "loss": 0.05986443758010864, + "mean_token_accuracy": 0.9786281704902648, + "num_tokens": 7709745.0, + "step": 3300 + }, + { + "epoch": 8.209215442092155, + "eval_entropy": 0.24329388124305149, + "eval_loss": 0.9021085500717163, + "eval_mean_token_accuracy": 0.8521762625422589, + "eval_num_tokens": 7709745.0, + "eval_runtime": 85.955, + "eval_samples_per_second": 15.997, + "eval_steps_per_second": 2.001, + "step": 3300 + }, + { + "entropy": 0.13265180448070168, + "epoch": 8.259028642590286, + "grad_norm": 0.18067947030067444, + "learning_rate": 2.0320434085659692e-05, + "loss": 0.06724961400032044, + "mean_token_accuracy": 0.975098168104887, + "num_tokens": 7753571.0, + "step": 3320 + }, + { + "epoch": 8.259028642590286, + "eval_entropy": 0.2433211464694766, + "eval_loss": 0.9094350337982178, + "eval_mean_token_accuracy": 0.8520150094531304, + "eval_num_tokens": 7753571.0, + "eval_runtime": 85.7989, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.005, + "step": 3320 + }, + { + "entropy": 0.11949320202693343, + "epoch": 8.308841843088418, + "grad_norm": 0.17020289599895477, + "learning_rate": 1.9210999670114196e-05, + "loss": 0.0634455680847168, + "mean_token_accuracy": 0.9771294385194779, + "num_tokens": 7799310.0, + "step": 3340 + }, + { + "epoch": 8.308841843088418, + "eval_entropy": 0.24345201219237128, + "eval_loss": 0.9021793603897095, + "eval_mean_token_accuracy": 0.8520745697409607, + "eval_num_tokens": 7799310.0, + "eval_runtime": 86.0883, + "eval_samples_per_second": 15.972, + "eval_steps_per_second": 1.998, + "step": 3340 + }, + { + "entropy": 0.12065747743472457, + "epoch": 8.35865504358655, + "grad_norm": 0.16789060831069946, + "learning_rate": 1.8129892878049886e-05, + "loss": 0.061494195461273195, + "mean_token_accuracy": 0.9779584899544715, + "num_tokens": 7846447.0, + "step": 3360 + }, + { + "epoch": 8.35865504358655, + "eval_entropy": 0.24093415042342142, + "eval_loss": 0.9006755352020264, + "eval_mean_token_accuracy": 0.852174230786257, + "eval_num_tokens": 7846447.0, + "eval_runtime": 85.9011, + "eval_samples_per_second": 16.007, + "eval_steps_per_second": 2.002, + "step": 3360 + }, + { + "entropy": 0.13125578537583352, + "epoch": 8.408468244084682, + "grad_norm": 0.1662452220916748, + "learning_rate": 1.70774397565298e-05, + "loss": 0.06685600876808166, + "mean_token_accuracy": 0.9744067586958408, + "num_tokens": 7890283.0, + "step": 3380 + }, + { + "epoch": 8.408468244084682, + "eval_entropy": 0.24062153688350388, + "eval_loss": 0.9078915119171143, + "eval_mean_token_accuracy": 0.8523201647886011, + "eval_num_tokens": 7890283.0, + "eval_runtime": 86.0201, + "eval_samples_per_second": 15.985, + "eval_steps_per_second": 2.0, + "step": 3380 + }, + { + "entropy": 0.11986117120832204, + "epoch": 8.458281444582815, + "grad_norm": 0.19571948051452637, + "learning_rate": 1.6053957711060606e-05, + "loss": 0.06411095261573792, + "mean_token_accuracy": 0.9770627245306969, + "num_tokens": 7936518.0, + "step": 3400 + }, + { + "epoch": 8.458281444582815, + "eval_entropy": 0.24352820347561394, + "eval_loss": 0.9058943390846252, + "eval_mean_token_accuracy": 0.8519382792156797, + "eval_num_tokens": 7936518.0, + "eval_runtime": 85.966, + "eval_samples_per_second": 15.995, + "eval_steps_per_second": 2.001, + "step": 3400 + }, + { + "entropy": 0.12857897616922856, + "epoch": 8.508094645080947, + "grad_norm": 0.2609264850616455, + "learning_rate": 1.5059755409867613e-05, + "loss": 0.06473397612571716, + "mean_token_accuracy": 0.9764650195837021, + "num_tokens": 7981966.0, + "step": 3420 + }, + { + "epoch": 8.508094645080947, + "eval_entropy": 0.24032609000108962, + "eval_loss": 0.9077776074409485, + "eval_mean_token_accuracy": 0.8517829197090726, + "eval_num_tokens": 7981966.0, + "eval_runtime": 86.6059, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 3420 + }, + { + "entropy": 0.12348870886489749, + "epoch": 8.557907845579079, + "grad_norm": 0.19537609815597534, + "learning_rate": 1.409513269080473e-05, + "loss": 0.06481348872184753, + "mean_token_accuracy": 0.9769559659063816, + "num_tokens": 8028367.0, + "step": 3440 + }, + { + "epoch": 8.557907845579079, + "eval_entropy": 0.2404322574824788, + "eval_loss": 0.9057720899581909, + "eval_mean_token_accuracy": 0.8521037981953732, + "eval_num_tokens": 8028367.0, + "eval_runtime": 86.166, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.996, + "step": 3440 + }, + { + "entropy": 0.12040232736617326, + "epoch": 8.607721046077211, + "grad_norm": 0.3310582935810089, + "learning_rate": 1.3160380470927183e-05, + "loss": 0.06468871235847473, + "mean_token_accuracy": 0.9768650442361831, + "num_tokens": 8074934.0, + "step": 3460 + }, + { + "epoch": 8.607721046077211, + "eval_entropy": 0.24118655876711356, + "eval_loss": 0.9028318524360657, + "eval_mean_token_accuracy": 0.8521025340224422, + "eval_num_tokens": 8074934.0, + "eval_runtime": 85.3668, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.015, + "step": 3460 + }, + { + "entropy": 0.12328103906475008, + "epoch": 8.657534246575342, + "grad_norm": 0.12836167216300964, + "learning_rate": 1.2255780658755122e-05, + "loss": 0.06229386329650879, + "mean_token_accuracy": 0.9763277888298034, + "num_tokens": 8122775.0, + "step": 3480 + }, + { + "epoch": 8.657534246575342, + "eval_entropy": 0.24194598145956217, + "eval_loss": 0.9009329080581665, + "eval_mean_token_accuracy": 0.8521693289973015, + "eval_num_tokens": 8122775.0, + "eval_runtime": 85.9415, + "eval_samples_per_second": 15.999, + "eval_steps_per_second": 2.001, + "step": 3480 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.4298419809161626e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3500/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3500/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3500/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3500/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3500/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3500/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3500/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3500/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3500/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3500/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3500/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3500/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3500/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3500/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..f9663eb44b248758b63dc792d36122b642b56113 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3500/trainer_state.json @@ -0,0 +1,3709 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 8.707347447073474, + "eval_steps": 20, + "global_step": 3500, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + }, + { + "entropy": 0.561330484598875, + "epoch": 1.891656288916563, + "grad_norm": 0.6722865700721741, + "learning_rate": 0.0002208867897174789, + "loss": 0.499837589263916, + "mean_token_accuracy": 0.8518734864890576, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.5865232653396074, + "eval_loss": 0.5437926650047302, + "eval_mean_token_accuracy": 0.8450997017843779, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4116, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.547389242425561, + "epoch": 1.9414694894146949, + "grad_norm": 0.7935577034950256, + "learning_rate": 0.00022027119820226907, + "loss": 0.4977591514587402, + "mean_token_accuracy": 0.8539491161704064, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.5290903090391048, + "eval_loss": 0.5409526824951172, + "eval_mean_token_accuracy": 0.8497545698354411, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.7262, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 780 + }, + { + "entropy": 0.5687909748405218, + "epoch": 1.9912826899128269, + "grad_norm": 0.6180546283721924, + "learning_rate": 0.00021962329729698345, + "loss": 0.5109643459320068, + "mean_token_accuracy": 0.8521598495543004, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.5503541858390321, + "eval_loss": 0.5361555218696594, + "eval_mean_token_accuracy": 0.8510884285666221, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.3339, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 800 + }, + { + "entropy": 0.4739728841261986, + "epoch": 2.0398505603985058, + "grad_norm": 0.8058829307556152, + "learning_rate": 0.0002189432823996982, + "loss": 0.4204097747802734, + "mean_token_accuracy": 0.8728981889211215, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.5077334992414297, + "eval_loss": 0.5531114339828491, + "eval_mean_token_accuracy": 0.8489257208136625, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.4801, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.989, + "step": 820 + }, + { + "entropy": 0.4594309840351343, + "epoch": 2.0896637608966375, + "grad_norm": 0.6906896829605103, + "learning_rate": 0.0002182313585936314, + "loss": 0.4071959495544434, + "mean_token_accuracy": 0.8732857562601566, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.49850136994622474, + "eval_loss": 0.5486204624176025, + "eval_mean_token_accuracy": 0.8507991450470548, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.3364, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.4881629109382629, + "epoch": 2.1394769613947697, + "grad_norm": 0.6343470215797424, + "learning_rate": 0.0002174877405852928, + "loss": 0.41669540405273436, + "mean_token_accuracy": 0.8711295068264008, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.49155513924914734, + "eval_loss": 0.555109441280365, + "eval_mean_token_accuracy": 0.8496399400539176, + "eval_num_tokens": 2008562.0, + "eval_runtime": 86.3295, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 860 + }, + { + "entropy": 0.4648668970912695, + "epoch": 2.1892901618929015, + "grad_norm": 0.8014165163040161, + "learning_rate": 0.00021671265263973133, + "loss": 0.4110250473022461, + "mean_token_accuracy": 0.8754166305065155, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.4909258722219356, + "eval_loss": 0.5539511442184448, + "eval_mean_token_accuracy": 0.8492401502160138, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.3468, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 880 + }, + { + "entropy": 0.4824485514312983, + "epoch": 2.2391033623910337, + "grad_norm": 0.6665191054344177, + "learning_rate": 0.00021590632851289967, + "loss": 0.4181404113769531, + "mean_token_accuracy": 0.8726993151009083, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.4986876940657926, + "eval_loss": 0.547695517539978, + "eval_mean_token_accuracy": 0.8501384708770486, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.3838, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 900 + }, + { + "entropy": 0.4751896943897009, + "epoch": 2.2889165628891655, + "grad_norm": 0.81158047914505, + "learning_rate": 0.00021506901138115678, + "loss": 0.40689678192138673, + "mean_token_accuracy": 0.8745221219956875, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.507153491121392, + "eval_loss": 0.5501641631126404, + "eval_mean_token_accuracy": 0.8495670116918032, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.0912, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 920 + }, + { + "entropy": 0.4873133715242147, + "epoch": 2.3387297633872977, + "grad_norm": 0.7218056321144104, + "learning_rate": 0.0002142009537679292, + "loss": 0.42701358795166017, + "mean_token_accuracy": 0.8695114746689796, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5202612736543943, + "eval_loss": 0.5491839051246643, + "eval_mean_token_accuracy": 0.8494071208460386, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.1142, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 940 + }, + { + "entropy": 0.4762951169162989, + "epoch": 2.3885429638854294, + "grad_norm": 0.7194424867630005, + "learning_rate": 0.0002133024174675534, + "loss": 0.42299847602844237, + "mean_token_accuracy": 0.8709790132939815, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4899340462546016, + "eval_loss": 0.5522511601448059, + "eval_mean_token_accuracy": 0.8492208258357159, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.463, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 960 + }, + { + "entropy": 0.49650347977876663, + "epoch": 2.4383561643835616, + "grad_norm": 0.8406022787094116, + "learning_rate": 0.0002123736734663221, + "loss": 0.4275330066680908, + "mean_token_accuracy": 0.8670595556497573, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.49691385654515996, + "eval_loss": 0.5491269826889038, + "eval_mean_token_accuracy": 0.850309816210769, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.17, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 980 + }, + { + "entropy": 0.48843890577554705, + "epoch": 2.488169364881694, + "grad_norm": 0.9082473516464233, + "learning_rate": 0.00021141500186075868, + "loss": 0.4309722423553467, + "mean_token_accuracy": 0.8686766296625137, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5543508351195691, + "eval_loss": 0.5478800535202026, + "eval_mean_token_accuracy": 0.8478029522784921, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.3835, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 1000 + }, + { + "entropy": 0.4777219031006098, + "epoch": 2.5379825653798256, + "grad_norm": 0.7448089122772217, + "learning_rate": 0.0002104266917731438, + "loss": 0.423325252532959, + "mean_token_accuracy": 0.8706337086856365, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.49857561550168106, + "eval_loss": 0.5511948466300964, + "eval_mean_token_accuracy": 0.8502220289651737, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.5399, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.988, + "step": 1020 + }, + { + "entropy": 0.4844174191355705, + "epoch": 2.587795765877958, + "grad_norm": 0.794029176235199, + "learning_rate": 0.00020940904126432, + "loss": 0.4176753044128418, + "mean_token_accuracy": 0.873535567522049, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.485467542222766, + "eval_loss": 0.5539286732673645, + "eval_mean_token_accuracy": 0.8495475081510322, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.135, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 1.997, + "step": 1040 + }, + { + "entropy": 0.49070929251611234, + "epoch": 2.6376089663760895, + "grad_norm": 0.7558256983757019, + "learning_rate": 0.0002083623572438007, + "loss": 0.42867293357849123, + "mean_token_accuracy": 0.8696666076779366, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.490822730889154, + "eval_loss": 0.5434785485267639, + "eval_mean_token_accuracy": 0.850568296950917, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.4933, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 1060 + }, + { + "entropy": 0.47806114703416824, + "epoch": 2.6874221668742218, + "grad_norm": 0.6608979105949402, + "learning_rate": 0.00020728695537721047, + "loss": 0.4289727687835693, + "mean_token_accuracy": 0.8693130135536193, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.5285773256490397, + "eval_loss": 0.5444230437278748, + "eval_mean_token_accuracy": 0.8498796481032704, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.7091, + "eval_samples_per_second": 15.858, + "eval_steps_per_second": 1.984, + "step": 1080 + }, + { + "entropy": 0.5046216730028391, + "epoch": 2.7372353673723535, + "grad_norm": 0.8428544998168945, + "learning_rate": 0.00020618315999108454, + "loss": 0.43131070137023925, + "mean_token_accuracy": 0.8701941035687923, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.49888394738352576, + "eval_loss": 0.5459766387939453, + "eval_mean_token_accuracy": 0.8511758872935938, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.2222, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.995, + "step": 1100 + }, + { + "entropy": 0.5212558470666409, + "epoch": 2.7870485678704857, + "grad_norm": 1.129318118095398, + "learning_rate": 0.00020505130397505635, + "loss": 0.44249300956726073, + "mean_token_accuracy": 0.8654101334512234, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5179622324053631, + "eval_loss": 0.5522801280021667, + "eval_mean_token_accuracy": 0.8497019947268242, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.1903, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.996, + "step": 1120 + }, + { + "entropy": 0.4988406613469124, + "epoch": 2.8368617683686175, + "grad_norm": 0.6460545063018799, + "learning_rate": 0.00020389172868146263, + "loss": 0.4386270523071289, + "mean_token_accuracy": 0.8690383620560169, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.5042278484203094, + "eval_loss": 0.5433034300804138, + "eval_mean_token_accuracy": 0.8497674451317898, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.3028, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.993, + "step": 1140 + }, + { + "entropy": 0.4926559619605541, + "epoch": 2.8866749688667497, + "grad_norm": 0.8199329972267151, + "learning_rate": 0.00020270478382239615, + "loss": 0.4313485145568848, + "mean_token_accuracy": 0.8674727231264114, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.503873193160046, + "eval_loss": 0.5388111472129822, + "eval_mean_token_accuracy": 0.8526195034731266, + "eval_num_tokens": 2710196.0, + "eval_runtime": 86.4054, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.991, + "step": 1160 + }, + { + "entropy": 0.5020013231784105, + "epoch": 2.936488169364882, + "grad_norm": 0.7344821095466614, + "learning_rate": 0.00020149082736423723, + "loss": 0.43590536117553713, + "mean_token_accuracy": 0.8671772189438343, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5368241809828337, + "eval_loss": 0.5355703830718994, + "eval_mean_token_accuracy": 0.8517617773871089, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.2945, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1180 + }, + { + "entropy": 0.5112275708466768, + "epoch": 2.9863013698630136, + "grad_norm": 0.6951606869697571, + "learning_rate": 0.00020025022541969622, + "loss": 0.43579301834106443, + "mean_token_accuracy": 0.8641206480562686, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.5066795706055885, + "eval_loss": 0.5415249466896057, + "eval_mean_token_accuracy": 0.8493563373421513, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.5005, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.988, + "step": 1200 + }, + { + "entropy": 0.42298635305502474, + "epoch": 3.0348692403486925, + "grad_norm": 0.8201794028282166, + "learning_rate": 0.00019898335213739863, + "loss": 0.35593905448913576, + "mean_token_accuracy": 0.889238600547497, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.4584170470750609, + "eval_loss": 0.569487452507019, + "eval_mean_token_accuracy": 0.8495814173027526, + "eval_num_tokens": 2848509.0, + "eval_runtime": 86.2281, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 1220 + }, + { + "entropy": 0.37450140453875064, + "epoch": 3.0846824408468243, + "grad_norm": 0.7308394908905029, + "learning_rate": 0.0001976905895890471, + "loss": 0.307823920249939, + "mean_token_accuracy": 0.9001288741827012, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.45185995916294497, + "eval_loss": 0.5672881603240967, + "eval_mean_token_accuracy": 0.8511318519364955, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.0819, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.998, + "step": 1240 + }, + { + "entropy": 0.3887945845723152, + "epoch": 3.1344956413449565, + "grad_norm": 0.7299330830574036, + "learning_rate": 0.0001963723276541939, + "loss": 0.32047903537750244, + "mean_token_accuracy": 0.8960984498262405, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.44865354549053105, + "eval_loss": 0.5666037201881409, + "eval_mean_token_accuracy": 0.8496572649063066, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 1260 + }, + { + "entropy": 0.39677664265036583, + "epoch": 3.1843088418430883, + "grad_norm": 0.9533219933509827, + "learning_rate": 0.00019502896390265838, + "loss": 0.3253983497619629, + "mean_token_accuracy": 0.8964207418262958, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.4641980809527774, + "eval_loss": 0.5814996957778931, + "eval_mean_token_accuracy": 0.8485886212005171, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.7784, + "eval_samples_per_second": 15.845, + "eval_steps_per_second": 1.982, + "step": 1280 + }, + { + "entropy": 0.39210722744464876, + "epoch": 3.2341220423412205, + "grad_norm": 0.7447651028633118, + "learning_rate": 0.00019366090347462545, + "loss": 0.3276803970336914, + "mean_token_accuracy": 0.8930055953562259, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43595615254585135, + "eval_loss": 0.5722188353538513, + "eval_mean_token_accuracy": 0.8501105755567551, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.5271, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 1300 + }, + { + "entropy": 0.3684127271175385, + "epoch": 3.2839352428393527, + "grad_norm": 0.6934201121330261, + "learning_rate": 0.00019226855895846078, + "loss": 0.3156379222869873, + "mean_token_accuracy": 0.8976306475698947, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.4628148723480313, + "eval_loss": 0.5631352066993713, + "eval_mean_token_accuracy": 0.8504934813394103, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.3436, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 1320 + }, + { + "entropy": 0.4073401909321547, + "epoch": 3.3337484433374844, + "grad_norm": 0.9386897683143616, + "learning_rate": 0.00019085235026627994, + "loss": 0.34265310764312745, + "mean_token_accuracy": 0.8902062118053437, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.46455050623694133, + "eval_loss": 0.5586736798286438, + "eval_mean_token_accuracy": 0.8506874702004499, + "eval_num_tokens": 3132874.0, + "eval_runtime": 86.1286, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.997, + "step": 1340 + }, + { + "entropy": 0.4046429242938757, + "epoch": 3.383561643835616, + "grad_norm": 0.9633992314338684, + "learning_rate": 0.00018941270450730836, + "loss": 0.33816893100738527, + "mean_token_accuracy": 0.8927541889250279, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.46846531660750856, + "eval_loss": 0.561501681804657, + "eval_mean_token_accuracy": 0.8496256377114806, + "eval_num_tokens": 3178055.0, + "eval_runtime": 86.685, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1360 + }, + { + "entropy": 0.39872407019138334, + "epoch": 3.4333748443337484, + "grad_norm": 0.7786458730697632, + "learning_rate": 0.00018795005585907113, + "loss": 0.33342490196228025, + "mean_token_accuracy": 0.8944805048406124, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.42709505973860273, + "eval_loss": 0.5751848220825195, + "eval_mean_token_accuracy": 0.8507290447867194, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.6892, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 1380 + }, + { + "entropy": 0.3923338124528527, + "epoch": 3.4831880448318806, + "grad_norm": 0.9305956363677979, + "learning_rate": 0.0001864648454364511, + "loss": 0.33188116550445557, + "mean_token_accuracy": 0.8943330392241478, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.4386174779298694, + "eval_loss": 0.5680831074714661, + "eval_mean_token_accuracy": 0.8513129727784977, + "eval_num_tokens": 3274096.0, + "eval_runtime": 86.2671, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 1400 + }, + { + "entropy": 0.3856233984231949, + "epoch": 3.5330012453300124, + "grad_norm": 1.0362752676010132, + "learning_rate": 0.0001849575211586545, + "loss": 0.33098697662353516, + "mean_token_accuracy": 0.8961390435695649, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4574795474493226, + "eval_loss": 0.5630439519882202, + "eval_mean_token_accuracy": 0.8520988873964133, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.6035, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 1420 + }, + { + "entropy": 0.39812871962785723, + "epoch": 3.5828144458281446, + "grad_norm": 0.7807195782661438, + "learning_rate": 0.0001834285376141247, + "loss": 0.3333771228790283, + "mean_token_accuracy": 0.8930827379226685, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.4556825893909432, + "eval_loss": 0.5689062476158142, + "eval_mean_token_accuracy": 0.8507103507601937, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.1606, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.996, + "step": 1440 + }, + { + "entropy": 0.4147744856774807, + "epoch": 3.6326276463262763, + "grad_norm": 0.6429352164268494, + "learning_rate": 0.00018187835592344443, + "loss": 0.3482560873031616, + "mean_token_accuracy": 0.8910200245678425, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.46600024540757023, + "eval_loss": 0.5609709024429321, + "eval_mean_token_accuracy": 0.8491220876227977, + "eval_num_tokens": 3415600.0, + "eval_runtime": 86.8039, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1460 + }, + { + "entropy": 0.40425071083009245, + "epoch": 3.6824408468244085, + "grad_norm": 0.8613698482513428, + "learning_rate": 0.0001803074436002682, + "loss": 0.342916464805603, + "mean_token_accuracy": 0.8916418336331844, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.43855057899342026, + "eval_loss": 0.5720968246459961, + "eval_mean_token_accuracy": 0.8500823641932288, + "eval_num_tokens": 3460471.0, + "eval_runtime": 86.6746, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1480 + }, + { + "entropy": 0.39465143866837027, + "epoch": 3.7322540473225407, + "grad_norm": 0.6285189986228943, + "learning_rate": 0.0001787162744103265, + "loss": 0.3424591779708862, + "mean_token_accuracy": 0.8906558901071548, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4509461877304454, + "eval_loss": 0.5590082406997681, + "eval_mean_token_accuracy": 0.8511747371318729, + "eval_num_tokens": 3507647.0, + "eval_runtime": 86.8126, + "eval_samples_per_second": 15.839, + "eval_steps_per_second": 1.981, + "step": 1500 + }, + { + "entropy": 0.4021005939692259, + "epoch": 3.7820672478206725, + "grad_norm": 0.8821248412132263, + "learning_rate": 0.00017710532822854468, + "loss": 0.3462103843688965, + "mean_token_accuracy": 0.889109355956316, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.4502199075596277, + "eval_loss": 0.566046416759491, + "eval_mean_token_accuracy": 0.8501714208098345, + "eval_num_tokens": 3548934.0, + "eval_runtime": 86.8336, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.981, + "step": 1520 + }, + { + "entropy": 0.4017397932708263, + "epoch": 3.8318804483188043, + "grad_norm": 0.8400952816009521, + "learning_rate": 0.0001754750908943189, + "loss": 0.34890995025634763, + "mean_token_accuracy": 0.8892098367214203, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.4614003023435903, + "eval_loss": 0.5617933869361877, + "eval_mean_token_accuracy": 0.8515863616106122, + "eval_num_tokens": 3597186.0, + "eval_runtime": 86.4609, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 1540 + }, + { + "entropy": 0.4112051840871572, + "epoch": 3.8816936488169365, + "grad_norm": 0.769478440284729, + "learning_rate": 0.0001738260540649939, + "loss": 0.34711437225341796, + "mean_token_accuracy": 0.8911717928946018, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4540443811998811, + "eval_loss": 0.5576469898223877, + "eval_mean_token_accuracy": 0.8512079674144124, + "eval_num_tokens": 3646646.0, + "eval_runtime": 86.5103, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 1560 + }, + { + "entropy": 0.41105241514742374, + "epoch": 3.9315068493150687, + "grad_norm": 0.8468427062034607, + "learning_rate": 0.00017215871506758568, + "loss": 0.3433023452758789, + "mean_token_accuracy": 0.8898739732801915, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.4707539707075718, + "eval_loss": 0.5641466379165649, + "eval_mean_token_accuracy": 0.8495440957851188, + "eval_num_tokens": 3689560.0, + "eval_runtime": 86.609, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.986, + "step": 1580 + }, + { + "entropy": 0.41016379147768023, + "epoch": 3.9813200498132004, + "grad_norm": 0.7482675313949585, + "learning_rate": 0.0001704735767487946, + "loss": 0.34550890922546384, + "mean_token_accuracy": 0.8893028847873211, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.46391099864660307, + "eval_loss": 0.5593640804290771, + "eval_mean_token_accuracy": 0.8510130581467651, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.3975, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 1600 + }, + { + "entropy": 0.33167599791135544, + "epoch": 4.029887920298879, + "grad_norm": 0.9435692429542542, + "learning_rate": 0.00016877114732335337, + "loss": 0.2716026544570923, + "mean_token_accuracy": 0.9133149828666296, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.38499350005457567, + "eval_loss": 0.6298249363899231, + "eval_mean_token_accuracy": 0.8488117071778275, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.2933, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1620 + }, + { + "entropy": 0.3000166634097695, + "epoch": 4.0797011207970115, + "grad_norm": 0.8080845475196838, + "learning_rate": 0.0001670519402207569, + "loss": 0.22617182731628419, + "mean_token_accuracy": 0.9253474645316601, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.370110988703578, + "eval_loss": 0.6338461637496948, + "eval_mean_token_accuracy": 0.8485634801692741, + "eval_num_tokens": 3828830.0, + "eval_runtime": 85.9508, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.001, + "step": 1640 + }, + { + "entropy": 0.2986910421401262, + "epoch": 4.129514321295143, + "grad_norm": 0.7310900092124939, + "learning_rate": 0.0001653164739304185, + "loss": 0.22367463111877442, + "mean_token_accuracy": 0.9252275295555592, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.3944379702037157, + "eval_loss": 0.6109381914138794, + "eval_mean_token_accuracy": 0.849291454220927, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.6728, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1660 + }, + { + "entropy": 0.3095553796738386, + "epoch": 4.179327521793275, + "grad_norm": 0.7059140801429749, + "learning_rate": 0.0001635652718453007, + "loss": 0.23651680946350098, + "mean_token_accuracy": 0.9208931416273117, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.3910588648949945, + "eval_loss": 0.6104469299316406, + "eval_mean_token_accuracy": 0.8486883893262508, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7612, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.982, + "step": 1680 + }, + { + "entropy": 0.3001101028174162, + "epoch": 4.229140722291407, + "grad_norm": 0.6787802577018738, + "learning_rate": 0.00016179886210406728, + "loss": 0.23130471706390382, + "mean_token_accuracy": 0.9233332790434361, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3794369170832079, + "eval_loss": 0.6182110905647278, + "eval_mean_token_accuracy": 0.8495433777570724, + "eval_num_tokens": 3967474.0, + "eval_runtime": 85.94, + "eval_samples_per_second": 16.0, + "eval_steps_per_second": 2.001, + "step": 1700 + }, + { + "entropy": 0.3031421799212694, + "epoch": 4.2789539227895395, + "grad_norm": 0.9732038378715515, + "learning_rate": 0.0001600177774318036, + "loss": 0.2359529733657837, + "mean_token_accuracy": 0.9217648565769195, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3923123094231583, + "eval_loss": 0.6057384610176086, + "eval_mean_token_accuracy": 0.8508818288182103, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7647, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.29365369994193313, + "epoch": 4.328767123287671, + "grad_norm": 0.7681498527526855, + "learning_rate": 0.0001582225549793541, + "loss": 0.2269371747970581, + "mean_token_accuracy": 0.9245341829955578, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.4011661055129628, + "eval_loss": 0.6144486665725708, + "eval_mean_token_accuracy": 0.8480324357054955, + "eval_num_tokens": 4062594.0, + "eval_runtime": 87.1306, + "eval_samples_per_second": 15.781, + "eval_steps_per_second": 1.974, + "step": 1740 + }, + { + "entropy": 0.29396994728595016, + "epoch": 4.378580323785803, + "grad_norm": 1.0001007318496704, + "learning_rate": 0.0001564137361613248, + "loss": 0.22777395248413085, + "mean_token_accuracy": 0.9262309700250626, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38518730195802314, + "eval_loss": 0.6202630400657654, + "eval_mean_token_accuracy": 0.8493869807137999, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6616, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.3096018506214023, + "epoch": 4.428393524283935, + "grad_norm": 1.0448365211486816, + "learning_rate": 0.00015459186649280024, + "loss": 0.23696351051330566, + "mean_token_accuracy": 0.9217322513461113, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.3946371126140273, + "eval_loss": 0.6079026460647583, + "eval_mean_token_accuracy": 0.8492515852978063, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6582, + "eval_samples_per_second": 15.867, + "eval_steps_per_second": 1.985, + "step": 1780 + }, + { + "entropy": 0.32619857545942066, + "epoch": 4.478206724782067, + "grad_norm": 0.7210651636123657, + "learning_rate": 0.00015275749542482337, + "loss": 0.24651215076446534, + "mean_token_accuracy": 0.9177676141262054, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.3947690814560236, + "eval_loss": 0.6065912246704102, + "eval_mean_token_accuracy": 0.8502957744653835, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.5959, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.986, + "step": 1800 + }, + { + "entropy": 0.3193941755220294, + "epoch": 4.5280199252802, + "grad_norm": 0.8281906843185425, + "learning_rate": 0.0001509111761786888, + "loss": 0.23936262130737304, + "mean_token_accuracy": 0.9201708927750587, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38704028864239537, + "eval_loss": 0.6006569266319275, + "eval_mean_token_accuracy": 0.8502406720505205, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.8059, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1820 + }, + { + "entropy": 0.3164879363030195, + "epoch": 4.577833125778331, + "grad_norm": 0.7892968654632568, + "learning_rate": 0.00014905346557909867, + "loss": 0.24541733264923096, + "mean_token_accuracy": 0.9175932116806507, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.38861122120951497, + "eval_loss": 0.6115967631340027, + "eval_mean_token_accuracy": 0.849471275196519, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.2946, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1840 + }, + { + "entropy": 0.3051785985007882, + "epoch": 4.627646326276463, + "grad_norm": 0.8109654188156128, + "learning_rate": 0.0001471849238862319, + "loss": 0.23433220386505127, + "mean_token_accuracy": 0.9206570319831371, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.37162452295076015, + "eval_loss": 0.6184061765670776, + "eval_mean_token_accuracy": 0.8501173268223918, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.6865, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1860 + }, + { + "entropy": 0.3168198253959417, + "epoch": 4.677459526774595, + "grad_norm": 0.9512342214584351, + "learning_rate": 0.0001453061146267775, + "loss": 0.23832404613494873, + "mean_token_accuracy": 0.9197044663131237, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3845940856912801, + "eval_loss": 0.606762707233429, + "eval_mean_token_accuracy": 0.8504838194957999, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.5175, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 1880 + }, + { + "entropy": 0.30791807882487776, + "epoch": 4.7272727272727275, + "grad_norm": 0.8123113512992859, + "learning_rate": 0.00014341760442398248, + "loss": 0.2395785331726074, + "mean_token_accuracy": 0.918928150832653, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.39762327222283494, + "eval_loss": 0.5994202494621277, + "eval_mean_token_accuracy": 0.8509274201337681, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.2873, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.993, + "step": 1900 + }, + { + "entropy": 0.3021434534341097, + "epoch": 4.777085927770859, + "grad_norm": 0.731787383556366, + "learning_rate": 0.000141519962826766, + "loss": 0.23494718074798585, + "mean_token_accuracy": 0.9201403826475143, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.3827026732439219, + "eval_loss": 0.5995895862579346, + "eval_mean_token_accuracy": 0.851468373523202, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.3006, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 1920 + }, + { + "entropy": 0.31626159623265265, + "epoch": 4.826899128268991, + "grad_norm": 0.8848487138748169, + "learning_rate": 0.00013961376213795132, + "loss": 0.2439030647277832, + "mean_token_accuracy": 0.9196575872600079, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.388698436839636, + "eval_loss": 0.6000174283981323, + "eval_mean_token_accuracy": 0.8518068187458571, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.8979, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.979, + "step": 1940 + }, + { + "entropy": 0.30520407035946845, + "epoch": 4.876712328767123, + "grad_norm": 0.8532460927963257, + "learning_rate": 0.00013769957724166695, + "loss": 0.23458616733551024, + "mean_token_accuracy": 0.9221912942826748, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.38777847102908203, + "eval_loss": 0.6004981398582458, + "eval_mean_token_accuracy": 0.8516481768253238, + "eval_num_tokens": 4578167.0, + "eval_runtime": 87.0777, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.975, + "step": 1960 + }, + { + "entropy": 0.3226448342204094, + "epoch": 4.926525529265255, + "grad_norm": 0.6945561766624451, + "learning_rate": 0.0001357779854299694, + "loss": 0.24048397541046143, + "mean_token_accuracy": 0.9195300146937371, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.38581624263247777, + "eval_loss": 0.6029234528541565, + "eval_mean_token_accuracy": 0.8514213260523108, + "eval_num_tokens": 4622316.0, + "eval_runtime": 85.8729, + "eval_samples_per_second": 16.012, + "eval_steps_per_second": 2.003, + "step": 1980 + }, + { + "entropy": 0.3051655298098922, + "epoch": 4.976338729763388, + "grad_norm": 0.7976452708244324, + "learning_rate": 0.00013384956622874001, + "loss": 0.23584742546081544, + "mean_token_accuracy": 0.9216851457953453, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.37913159246361533, + "eval_loss": 0.6057604551315308, + "eval_mean_token_accuracy": 0.8525801203971686, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.1145, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 2000 + }, + { + "entropy": 0.27438195240803254, + "epoch": 5.024906600249066, + "grad_norm": 0.6729586124420166, + "learning_rate": 0.0001319149012229075, + "loss": 0.19775952100753785, + "mean_token_accuracy": 0.9339428559327737, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.3448961910813354, + "eval_loss": 0.6750120520591736, + "eval_mean_token_accuracy": 0.8487970232963562, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.1169, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 2020 + }, + { + "entropy": 0.21423916313797237, + "epoch": 5.074719800747198, + "grad_norm": 0.6934391856193542, + "learning_rate": 0.00012997457388105022, + "loss": 0.1439570426940918, + "mean_token_accuracy": 0.9528236843645572, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.3570949243771475, + "eval_loss": 0.6465504169464111, + "eval_mean_token_accuracy": 0.8490785547467166, + "eval_num_tokens": 4763269.0, + "eval_runtime": 85.9574, + "eval_samples_per_second": 15.996, + "eval_steps_per_second": 2.001, + "step": 2040 + }, + { + "entropy": 0.20838565267622472, + "epoch": 5.12453300124533, + "grad_norm": 0.7286986112594604, + "learning_rate": 0.00012802916937942972, + "loss": 0.14467307329177856, + "mean_token_accuracy": 0.950994835793972, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.3452463157821533, + "eval_loss": 0.6705958843231201, + "eval_mean_token_accuracy": 0.8490352796953778, + "eval_num_tokens": 4809047.0, + "eval_runtime": 86.228, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 2060 + }, + { + "entropy": 0.20453082229942082, + "epoch": 5.174346201743462, + "grad_norm": 0.7515555620193481, + "learning_rate": 0.00012607927442550974, + "loss": 0.13732000589370727, + "mean_token_accuracy": 0.9537357829511166, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.32431264914745506, + "eval_loss": 0.6743043065071106, + "eval_mean_token_accuracy": 0.8504878629085629, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.5948, + "eval_samples_per_second": 15.879, + "eval_steps_per_second": 1.986, + "step": 2080 + }, + { + "entropy": 0.21812320686876774, + "epoch": 5.224159402241594, + "grad_norm": 0.9093465209007263, + "learning_rate": 0.0001241254770810132, + "loss": 0.14311420917510986, + "mean_token_accuracy": 0.9514068141579628, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.33086285835435225, + "eval_loss": 0.6676449179649353, + "eval_mean_token_accuracy": 0.8505287662495015, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 2100 + }, + { + "entropy": 0.2180163251236081, + "epoch": 5.273972602739726, + "grad_norm": 0.6703007221221924, + "learning_rate": 0.00012216836658457075, + "loss": 0.14803968667984008, + "mean_token_accuracy": 0.9521303348243236, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.33162341708707255, + "eval_loss": 0.6658875942230225, + "eval_mean_token_accuracy": 0.8500757605530495, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.6296, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 2120 + }, + { + "entropy": 0.22511130161583423, + "epoch": 5.323785803237858, + "grad_norm": 0.8078880906105042, + "learning_rate": 0.00012020853317401455, + "loss": 0.15228408575057983, + "mean_token_accuracy": 0.947144789993763, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3354601170434508, + "eval_loss": 0.6677829623222351, + "eval_mean_token_accuracy": 0.8482600024273229, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.4689, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.989, + "step": 2140 + }, + { + "entropy": 0.2244176059961319, + "epoch": 5.37359900373599, + "grad_norm": 0.9636075496673584, + "learning_rate": 0.00011824656790837037, + "loss": 0.15260883569717407, + "mean_token_accuracy": 0.9471467643976211, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.3381616926297199, + "eval_loss": 0.6694412231445312, + "eval_mean_token_accuracy": 0.8482369603805764, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.4147, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 2160 + }, + { + "entropy": 0.22982364390045404, + "epoch": 5.423412204234122, + "grad_norm": 0.775401771068573, + "learning_rate": 0.00011628306248960262, + "loss": 0.15140302181243898, + "mean_token_accuracy": 0.9492553934454918, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.3305150235808173, + "eval_loss": 0.6717822551727295, + "eval_mean_token_accuracy": 0.8489849723355715, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.4728, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.989, + "step": 2180 + }, + { + "entropy": 0.21448935717344284, + "epoch": 5.473225404732254, + "grad_norm": 0.6575281023979187, + "learning_rate": 0.00011431860908416465, + "loss": 0.1452319622039795, + "mean_token_accuracy": 0.9505287684500218, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3488145174328671, + "eval_loss": 0.6612305641174316, + "eval_mean_token_accuracy": 0.8492907808963642, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6927, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 2200 + }, + { + "entropy": 0.23091202937066554, + "epoch": 5.523038605230386, + "grad_norm": 0.8909686207771301, + "learning_rate": 0.00011235380014440985, + "loss": 0.15150139331817628, + "mean_token_accuracy": 0.9497875183820724, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.3268539015810157, + "eval_loss": 0.6667542457580566, + "eval_mean_token_accuracy": 0.8499062903398691, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.4644, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 2220 + }, + { + "entropy": 0.2227974807843566, + "epoch": 5.572851805728518, + "grad_norm": 0.6180275082588196, + "learning_rate": 0.0001103892282299158, + "loss": 0.1491069197654724, + "mean_token_accuracy": 0.9488144010305405, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3346347655494546, + "eval_loss": 0.6665948629379272, + "eval_mean_token_accuracy": 0.8499961893918903, + "eval_num_tokens": 5226864.0, + "eval_runtime": 87.0548, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.976, + "step": 2240 + }, + { + "entropy": 0.21368421968072654, + "epoch": 5.62266500622665, + "grad_norm": 0.6004369258880615, + "learning_rate": 0.00010842548582877651, + "loss": 0.14485255479812623, + "mean_token_accuracy": 0.9502056457102299, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.32753298804163933, + "eval_loss": 0.6680151224136353, + "eval_mean_token_accuracy": 0.8515451086121936, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.8524, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.98, + "step": 2260 + }, + { + "entropy": 0.2103635374456644, + "epoch": 5.672478206724782, + "grad_norm": 0.699174702167511, + "learning_rate": 0.00010646316517891613, + "loss": 0.14297772645950318, + "mean_token_accuracy": 0.9512537539005279, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.32966585959806, + "eval_loss": 0.675578773021698, + "eval_mean_token_accuracy": 0.8509623023659684, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.4518, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.99, + "step": 2280 + }, + { + "entropy": 0.22516900151968003, + "epoch": 5.722291407222914, + "grad_norm": 0.6637354493141174, + "learning_rate": 0.00010450285808947797, + "loss": 0.15202572345733642, + "mean_token_accuracy": 0.9482452072203159, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3369456917740578, + "eval_loss": 0.6697061061859131, + "eval_mean_token_accuracy": 0.848603522361711, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.6371, + "eval_samples_per_second": 15.871, + "eval_steps_per_second": 1.985, + "step": 2300 + }, + { + "entropy": 0.21841065725311637, + "epoch": 5.772104607721046, + "grad_norm": 0.7940268516540527, + "learning_rate": 0.00010254515576234297, + "loss": 0.14710167646408082, + "mean_token_accuracy": 0.9493498183786869, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3237486180177955, + "eval_loss": 0.6779657602310181, + "eval_mean_token_accuracy": 0.8500715313955794, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.1826, + "eval_samples_per_second": 15.954, + "eval_steps_per_second": 1.996, + "step": 2320 + }, + { + "entropy": 0.22146204356104135, + "epoch": 5.821917808219178, + "grad_norm": 0.9234833121299744, + "learning_rate": 0.00010059064861383132, + "loss": 0.14720046520233154, + "mean_token_accuracy": 0.9493872679769992, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.32365207564692167, + "eval_loss": 0.6704005002975464, + "eval_mean_token_accuracy": 0.8507985760306203, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.5494, + "eval_samples_per_second": 15.887, + "eval_steps_per_second": 1.987, + "step": 2340 + }, + { + "entropy": 0.20934011954814197, + "epoch": 5.87173100871731, + "grad_norm": 0.5547503232955933, + "learning_rate": 9.863992609664084e-05, + "loss": 0.1464867353439331, + "mean_token_accuracy": 0.9503875687718392, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.3330401429083458, + "eval_loss": 0.6659091114997864, + "eval_mean_token_accuracy": 0.8504848906467127, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.5855, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 2360 + }, + { + "entropy": 0.21678635366261007, + "epoch": 5.921544209215442, + "grad_norm": 0.570612907409668, + "learning_rate": 9.669357652207635e-05, + "loss": 0.14821385145187377, + "mean_token_accuracy": 0.9503940217196941, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3322022325077722, + "eval_loss": 0.6722489595413208, + "eval_mean_token_accuracy": 0.8489979422369669, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.2986, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 2380 + }, + { + "entropy": 0.20932920072227718, + "epoch": 5.971357409713574, + "grad_norm": 0.7879557609558105, + "learning_rate": 9.475218688262262e-05, + "loss": 0.14675841331481934, + "mean_token_accuracy": 0.9507176131010056, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.3199348642902319, + "eval_loss": 0.6698136329650879, + "eval_mean_token_accuracy": 0.8514142130003419, + "eval_num_tokens": 5605400.0, + "eval_runtime": 85.8995, + "eval_samples_per_second": 16.007, + "eval_steps_per_second": 2.002, + "step": 2400 + }, + { + "entropy": 0.21032143919131693, + "epoch": 6.019925280199253, + "grad_norm": 0.5823076367378235, + "learning_rate": 9.281634267491569e-05, + "loss": 0.13322267532348633, + "mean_token_accuracy": 0.9550939072401096, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.30206270117399303, + "eval_loss": 0.7093168497085571, + "eval_mean_token_accuracy": 0.8500627639681794, + "eval_num_tokens": 5648968.0, + "eval_runtime": 85.8128, + "eval_samples_per_second": 16.023, + "eval_steps_per_second": 2.004, + "step": 2420 + }, + { + "entropy": 0.1534628233872354, + "epoch": 6.069738480697385, + "grad_norm": 0.710133969783783, + "learning_rate": 9.088662772316508e-05, + "loss": 0.09078952670097351, + "mean_token_accuracy": 0.9678447999060154, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.28208133101809857, + "eval_loss": 0.7636417150497437, + "eval_mean_token_accuracy": 0.8494061477655588, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9724, + "eval_samples_per_second": 15.994, + "eval_steps_per_second": 2.001, + "step": 2440 + }, + { + "entropy": 0.16151462448760867, + "epoch": 6.119551681195516, + "grad_norm": 0.5793812274932861, + "learning_rate": 8.896362400308028e-05, + "loss": 0.09545697569847107, + "mean_token_accuracy": 0.9671573750674725, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.2833245605403601, + "eval_loss": 0.7402405738830566, + "eval_mean_token_accuracy": 0.8503523728875226, + "eval_num_tokens": 5745090.0, + "eval_runtime": 85.5461, + "eval_samples_per_second": 16.073, + "eval_steps_per_second": 2.011, + "step": 2460 + }, + { + "entropy": 0.15203177919611335, + "epoch": 6.169364881693649, + "grad_norm": 0.4251123368740082, + "learning_rate": 8.704791146635483e-05, + "loss": 0.09420782327651978, + "mean_token_accuracy": 0.9677386932075024, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.28572545962971313, + "eval_loss": 0.735416829586029, + "eval_mean_token_accuracy": 0.8487084663884584, + "eval_num_tokens": 5790333.0, + "eval_runtime": 85.4801, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.012, + "step": 2480 + }, + { + "entropy": 0.15587336672469973, + "epoch": 6.219178082191781, + "grad_norm": 0.4357028007507324, + "learning_rate": 8.514006786576085e-05, + "loss": 0.09429320096969604, + "mean_token_accuracy": 0.9682952925562859, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.2859006894882335, + "eval_loss": 0.7347224950790405, + "eval_mean_token_accuracy": 0.8501905518215757, + "eval_num_tokens": 5837321.0, + "eval_runtime": 85.7578, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.006, + "step": 2500 + }, + { + "entropy": 0.15765639198943973, + "epoch": 6.268991282689913, + "grad_norm": 0.47331130504608154, + "learning_rate": 8.324066858090663e-05, + "loss": 0.09571113586425781, + "mean_token_accuracy": 0.9683481335639954, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.29231513846059176, + "eval_loss": 0.7392512559890747, + "eval_mean_token_accuracy": 0.8486633983462356, + "eval_num_tokens": 5884398.0, + "eval_runtime": 85.7846, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.005, + "step": 2520 + }, + { + "entropy": 0.16176860257983208, + "epoch": 6.318804483188045, + "grad_norm": 0.6142018437385559, + "learning_rate": 8.135028644470992e-05, + "loss": 0.09486144185066223, + "mean_token_accuracy": 0.9682316601276397, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.2851274753379267, + "eval_loss": 0.7520816922187805, + "eval_mean_token_accuracy": 0.8501113649717597, + "eval_num_tokens": 5929876.0, + "eval_runtime": 85.9425, + "eval_samples_per_second": 15.999, + "eval_steps_per_second": 2.001, + "step": 2540 + }, + { + "entropy": 0.15404034564271568, + "epoch": 6.3686176836861765, + "grad_norm": 0.6051287651062012, + "learning_rate": 7.946949157063964e-05, + "loss": 0.09280472993850708, + "mean_token_accuracy": 0.9684635892510414, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28802703563557114, + "eval_loss": 0.7439162135124207, + "eval_mean_token_accuracy": 0.8499851770872293, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.0703, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.998, + "step": 2560 + }, + { + "entropy": 0.15343588953837753, + "epoch": 6.418430884184309, + "grad_norm": 0.4823743402957916, + "learning_rate": 7.759885118077701e-05, + "loss": 0.09000591039657593, + "mean_token_accuracy": 0.9699928767979145, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2795634938533916, + "eval_loss": 0.7647850513458252, + "eval_mean_token_accuracy": 0.8503464397995971, + "eval_num_tokens": 6025380.0, + "eval_runtime": 85.8886, + "eval_samples_per_second": 16.009, + "eval_steps_per_second": 2.003, + "step": 2580 + }, + { + "entropy": 0.15740026142448188, + "epoch": 6.468244084682441, + "grad_norm": 0.5082696676254272, + "learning_rate": 7.57389294347494e-05, + "loss": 0.09191849827766418, + "mean_token_accuracy": 0.9692809768021107, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2913342311458532, + "eval_loss": 0.7518694996833801, + "eval_mean_token_accuracy": 0.8483168302580367, + "eval_num_tokens": 6073349.0, + "eval_runtime": 85.5761, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.01, + "step": 2600 + }, + { + "entropy": 0.15922069251537324, + "epoch": 6.518057285180573, + "grad_norm": 0.3995199501514435, + "learning_rate": 7.389028725958736e-05, + "loss": 0.09584367871284485, + "mean_token_accuracy": 0.9685114495456218, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.2863075934177221, + "eval_loss": 0.7539381384849548, + "eval_mean_token_accuracy": 0.8507507083027862, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.112, + "eval_samples_per_second": 15.968, + "eval_steps_per_second": 1.997, + "step": 2620 + }, + { + "entropy": 0.16197575423866512, + "epoch": 6.567870485678705, + "grad_norm": 0.534295380115509, + "learning_rate": 7.205348218055678e-05, + "loss": 0.0961170256137848, + "mean_token_accuracy": 0.9674530044198036, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.29021967315050057, + "eval_loss": 0.751198947429657, + "eval_mean_token_accuracy": 0.8509796344956686, + "eval_num_tokens": 6165523.0, + "eval_runtime": 85.7958, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.005, + "step": 2640 + }, + { + "entropy": 0.15261746793985367, + "epoch": 6.617683686176837, + "grad_norm": 0.5391237139701843, + "learning_rate": 7.022906815301673e-05, + "loss": 0.0926026999950409, + "mean_token_accuracy": 0.9695659473538398, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.29128045216202736, + "eval_loss": 0.7450292110443115, + "eval_mean_token_accuracy": 0.8498771443616512, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.3963, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 2660 + }, + { + "entropy": 0.16164180357009172, + "epoch": 6.667496886674969, + "grad_norm": 0.5767946243286133, + "learning_rate": 6.841759539535419e-05, + "loss": 0.09291981458663941, + "mean_token_accuracy": 0.9687136687338352, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2897637223088464, + "eval_loss": 0.7503410577774048, + "eval_mean_token_accuracy": 0.8503315164599308, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.0653, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.998, + "step": 2680 + }, + { + "entropy": 0.17062523355707526, + "epoch": 6.717310087173101, + "grad_norm": 0.4974168539047241, + "learning_rate": 6.661961022304563e-05, + "loss": 0.09713236689567566, + "mean_token_accuracy": 0.9661971725523472, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2765843396963075, + "eval_loss": 0.7604002356529236, + "eval_mean_token_accuracy": 0.8521115277395692, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.1676, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 2700 + }, + { + "entropy": 0.17544092936441302, + "epoch": 6.767123287671232, + "grad_norm": 0.5523537993431091, + "learning_rate": 6.483565488389582e-05, + "loss": 0.09709116220474243, + "mean_token_accuracy": 0.9650957375764847, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.27939334659035814, + "eval_loss": 0.7534670829772949, + "eval_mean_token_accuracy": 0.851230604010959, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.2913, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 2720 + }, + { + "entropy": 0.15991022661328316, + "epoch": 6.816936488169365, + "grad_norm": 0.478551983833313, + "learning_rate": 6.306626739450311e-05, + "loss": 0.09564646482467651, + "mean_token_accuracy": 0.9679084822535515, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.27878295491601146, + "eval_loss": 0.7519959211349487, + "eval_mean_token_accuracy": 0.8510654949864676, + "eval_num_tokens": 6397720.0, + "eval_runtime": 85.9109, + "eval_samples_per_second": 16.005, + "eval_steps_per_second": 2.002, + "step": 2740 + }, + { + "entropy": 0.16824879590421915, + "epoch": 6.866749688667497, + "grad_norm": 0.6681098937988281, + "learning_rate": 6.131198137800108e-05, + "loss": 0.0962279736995697, + "mean_token_accuracy": 0.966830012947321, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.2834690434121808, + "eval_loss": 0.751922070980072, + "eval_mean_token_accuracy": 0.8521237577809844, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.3618, + "eval_samples_per_second": 15.921, + "eval_steps_per_second": 1.992, + "step": 2760 + }, + { + "entropy": 0.1518704930320382, + "epoch": 6.916562889165629, + "grad_norm": 0.5201290249824524, + "learning_rate": 5.957332590312513e-05, + "loss": 0.09010660648345947, + "mean_token_accuracy": 0.9693463340401649, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.28485129617674404, + "eval_loss": 0.7452457547187805, + "eval_mean_token_accuracy": 0.8512036796919135, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.4524, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.99, + "step": 2780 + }, + { + "entropy": 0.15512610590085388, + "epoch": 6.966376089663761, + "grad_norm": 0.42802050709724426, + "learning_rate": 5.785082532465233e-05, + "loss": 0.09320432543754578, + "mean_token_accuracy": 0.9686134628951549, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.27554594526110693, + "eval_loss": 0.7644653916358948, + "eval_mean_token_accuracy": 0.8513738523389018, + "eval_num_tokens": 6540175.0, + "eval_runtime": 85.7609, + "eval_samples_per_second": 16.033, + "eval_steps_per_second": 2.006, + "step": 2800 + }, + { + "entropy": 0.17524497526196334, + "epoch": 7.01494396014944, + "grad_norm": 0.3330269157886505, + "learning_rate": 5.6144999125263545e-05, + "loss": 0.0895616888999939, + "mean_token_accuracy": 0.9682766932707566, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.2735865569218647, + "eval_loss": 0.768479585647583, + "eval_mean_token_accuracy": 0.8503459383581959, + "eval_num_tokens": 6583767.0, + "eval_runtime": 85.7162, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.007, + "step": 2820 + }, + { + "entropy": 0.1403565663844347, + "epoch": 7.064757160647572, + "grad_norm": 0.35613498091697693, + "learning_rate": 5.4456361758874235e-05, + "loss": 0.07551313638687134, + "mean_token_accuracy": 0.9739301167428493, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.25941789089593775, + "eval_loss": 0.8209511637687683, + "eval_mean_token_accuracy": 0.8505055855873019, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.0943, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 2840 + }, + { + "entropy": 0.13500106502324344, + "epoch": 7.114570361145703, + "grad_norm": 0.34418627619743347, + "learning_rate": 5.2785422495482234e-05, + "loss": 0.07293946146965027, + "mean_token_accuracy": 0.9747208289802074, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.26482899772912954, + "eval_loss": 0.798904538154602, + "eval_mean_token_accuracy": 0.8511530233677044, + "eval_num_tokens": 6672946.0, + "eval_runtime": 85.7915, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.005, + "step": 2860 + }, + { + "entropy": 0.13127502552233636, + "epoch": 7.164383561643835, + "grad_norm": 0.4638441503047943, + "learning_rate": 5.113268526757892e-05, + "loss": 0.07121461629867554, + "mean_token_accuracy": 0.9756786689162255, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2645381211714689, + "eval_loss": 0.809101939201355, + "eval_mean_token_accuracy": 0.8514727898115335, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.84, + "eval_samples_per_second": 16.018, + "eval_steps_per_second": 2.004, + "step": 2880 + }, + { + "entropy": 0.1331390908919275, + "epoch": 7.214196762141968, + "grad_norm": 0.40206775069236755, + "learning_rate": 4.949864851817007e-05, + "loss": 0.07188264131546021, + "mean_token_accuracy": 0.9755406074225903, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.26244733283339544, + "eval_loss": 0.8143188953399658, + "eval_mean_token_accuracy": 0.8514358189909957, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.8546, + "eval_samples_per_second": 16.015, + "eval_steps_per_second": 2.003, + "step": 2900 + }, + { + "entropy": 0.13647331558167936, + "epoch": 7.2640099626401, + "grad_norm": 0.26405787467956543, + "learning_rate": 4.788380505045224e-05, + "loss": 0.07412450313568116, + "mean_token_accuracy": 0.9744274213910102, + "num_tokens": 6809678.0, + "step": 2920 + }, + { + "epoch": 7.2640099626401, + "eval_entropy": 0.2626111418182074, + "eval_loss": 0.8111525177955627, + "eval_mean_token_accuracy": 0.8512121695418691, + "eval_num_tokens": 6809678.0, + "eval_runtime": 85.9626, + "eval_samples_per_second": 15.995, + "eval_steps_per_second": 2.001, + "step": 2920 + }, + { + "entropy": 0.12644002586603165, + "epoch": 7.313823163138232, + "grad_norm": 0.27514681220054626, + "learning_rate": 4.6288641879189884e-05, + "loss": 0.06807711124420165, + "mean_token_accuracy": 0.9760703906416893, + "num_tokens": 6860750.0, + "step": 2940 + }, + { + "epoch": 7.313823163138232, + "eval_entropy": 0.26096762734097106, + "eval_loss": 0.8184595108032227, + "eval_mean_token_accuracy": 0.8501476153384807, + "eval_num_tokens": 6860750.0, + "eval_runtime": 85.9521, + "eval_samples_per_second": 15.997, + "eval_steps_per_second": 2.001, + "step": 2940 + }, + { + "entropy": 0.13920630998909472, + "epoch": 7.363636363636363, + "grad_norm": 0.23584705591201782, + "learning_rate": 4.4713640083838604e-05, + "loss": 0.07301607131958007, + "mean_token_accuracy": 0.9745715200901032, + "num_tokens": 6907092.0, + "step": 2960 + }, + { + "epoch": 7.363636363636363, + "eval_entropy": 0.2612536767021168, + "eval_loss": 0.8116245269775391, + "eval_mean_token_accuracy": 0.8510967350976412, + "eval_num_tokens": 6907092.0, + "eval_runtime": 85.6373, + "eval_samples_per_second": 16.056, + "eval_steps_per_second": 2.008, + "step": 2960 + }, + { + "entropy": 0.1349492883309722, + "epoch": 7.4134495641344955, + "grad_norm": 0.24552719295024872, + "learning_rate": 4.315927466345791e-05, + "loss": 0.07397544980049134, + "mean_token_accuracy": 0.9745095103979111, + "num_tokens": 6952700.0, + "step": 2980 + }, + { + "epoch": 7.4134495641344955, + "eval_entropy": 0.25796533306670744, + "eval_loss": 0.8266491293907166, + "eval_mean_token_accuracy": 0.8511653857868772, + "eval_num_tokens": 6952700.0, + "eval_runtime": 85.7462, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.006, + "step": 2980 + }, + { + "entropy": 0.14479175000451505, + "epoch": 7.463262764632628, + "grad_norm": 0.2846072018146515, + "learning_rate": 4.162601439345814e-05, + "loss": 0.07544798254966736, + "mean_token_accuracy": 0.9727819666266442, + "num_tokens": 6996430.0, + "step": 3000 + }, + { + "epoch": 7.463262764632628, + "eval_entropy": 0.2584348309698493, + "eval_loss": 0.8253348469734192, + "eval_mean_token_accuracy": 0.8511569815319638, + "eval_num_tokens": 6996430.0, + "eval_runtime": 86.2984, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 3000 + }, + { + "entropy": 0.14114196319133043, + "epoch": 7.51307596513076, + "grad_norm": 0.407966285943985, + "learning_rate": 4.011432168422419e-05, + "loss": 0.0736398994922638, + "mean_token_accuracy": 0.9741654269397259, + "num_tokens": 7042038.0, + "step": 3020 + }, + { + "epoch": 7.51307596513076, + "eval_entropy": 0.25232676260693127, + "eval_loss": 0.8296052813529968, + "eval_mean_token_accuracy": 0.8523298349491385, + "eval_num_tokens": 7042038.0, + "eval_runtime": 85.8445, + "eval_samples_per_second": 16.017, + "eval_steps_per_second": 2.004, + "step": 3020 + }, + { + "entropy": 0.1353456223383546, + "epoch": 7.562889165628892, + "grad_norm": 0.2712634801864624, + "learning_rate": 3.8624652441658684e-05, + "loss": 0.07362412214279175, + "mean_token_accuracy": 0.9747945807874203, + "num_tokens": 7089390.0, + "step": 3040 + }, + { + "epoch": 7.562889165628892, + "eval_entropy": 0.2579477243991785, + "eval_loss": 0.8274564743041992, + "eval_mean_token_accuracy": 0.8517705212498821, + "eval_num_tokens": 7089390.0, + "eval_runtime": 85.8222, + "eval_samples_per_second": 16.022, + "eval_steps_per_second": 2.004, + "step": 3040 + }, + { + "entropy": 0.1296080862637609, + "epoch": 7.6127023661270234, + "grad_norm": 0.2371893972158432, + "learning_rate": 3.715745592968707e-05, + "loss": 0.06971035599708557, + "mean_token_accuracy": 0.9759043246507645, + "num_tokens": 7138002.0, + "step": 3060 + }, + { + "epoch": 7.6127023661270234, + "eval_entropy": 0.25391967083479083, + "eval_loss": 0.8197130560874939, + "eval_mean_token_accuracy": 0.8522267875283264, + "eval_num_tokens": 7138002.0, + "eval_runtime": 85.8796, + "eval_samples_per_second": 16.011, + "eval_steps_per_second": 2.003, + "step": 3060 + }, + { + "entropy": 0.1311203008517623, + "epoch": 7.662515566625156, + "grad_norm": 0.22499267756938934, + "learning_rate": 3.5713174634765967e-05, + "loss": 0.07176244258880615, + "mean_token_accuracy": 0.9754939571022987, + "num_tokens": 7185520.0, + "step": 3080 + }, + { + "epoch": 7.662515566625156, + "eval_entropy": 0.2526215241225653, + "eval_loss": 0.8265154361724854, + "eval_mean_token_accuracy": 0.8519952584837758, + "eval_num_tokens": 7185520.0, + "eval_runtime": 85.8746, + "eval_samples_per_second": 16.012, + "eval_steps_per_second": 2.003, + "step": 3080 + }, + { + "entropy": 0.13420484317466616, + "epoch": 7.712328767123288, + "grad_norm": 0.2398064285516739, + "learning_rate": 3.4292244132434866e-05, + "loss": 0.07559212446212768, + "mean_token_accuracy": 0.9743142127990723, + "num_tokens": 7232170.0, + "step": 3100 + }, + { + "epoch": 7.712328767123288, + "eval_entropy": 0.2484562756537005, + "eval_loss": 0.8312150239944458, + "eval_mean_token_accuracy": 0.8528405119513356, + "eval_num_tokens": 7232170.0, + "eval_runtime": 85.7896, + "eval_samples_per_second": 16.028, + "eval_steps_per_second": 2.005, + "step": 3100 + }, + { + "entropy": 0.11965563679113984, + "epoch": 7.76214196762142, + "grad_norm": 0.3408384919166565, + "learning_rate": 3.2895092955952746e-05, + "loss": 0.0661750853061676, + "mean_token_accuracy": 0.9776600524783134, + "num_tokens": 7282846.0, + "step": 3120 + }, + { + "epoch": 7.76214196762142, + "eval_entropy": 0.2522421533804993, + "eval_loss": 0.8327009677886963, + "eval_mean_token_accuracy": 0.8524222023958383, + "eval_num_tokens": 7282846.0, + "eval_runtime": 86.1769, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 1.996, + "step": 3120 + }, + { + "entropy": 0.13388084415346385, + "epoch": 7.811955168119551, + "grad_norm": 0.35418516397476196, + "learning_rate": 3.152214246705829e-05, + "loss": 0.07149899601936341, + "mean_token_accuracy": 0.9747635535895824, + "num_tokens": 7331518.0, + "step": 3140 + }, + { + "epoch": 7.811955168119551, + "eval_entropy": 0.25038352296795957, + "eval_loss": 0.836457371711731, + "eval_mean_token_accuracy": 0.8526130665180295, + "eval_num_tokens": 7331518.0, + "eval_runtime": 85.6099, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.009, + "step": 3140 + }, + { + "entropy": 0.13530643959529698, + "epoch": 7.861768368617684, + "grad_norm": 0.38060539960861206, + "learning_rate": 3.017380672889291e-05, + "loss": 0.07116585969924927, + "mean_token_accuracy": 0.973284512758255, + "num_tokens": 7379056.0, + "step": 3160 + }, + { + "epoch": 7.861768368617684, + "eval_entropy": 0.255092611319797, + "eval_loss": 0.8314701914787292, + "eval_mean_token_accuracy": 0.8520913099826768, + "eval_num_tokens": 7379056.0, + "eval_runtime": 85.877, + "eval_samples_per_second": 16.011, + "eval_steps_per_second": 2.003, + "step": 3160 + }, + { + "entropy": 0.13383390177041293, + "epoch": 7.911581569115816, + "grad_norm": 0.3827536106109619, + "learning_rate": 2.8850492381124808e-05, + "loss": 0.07305437326431274, + "mean_token_accuracy": 0.9750778004527092, + "num_tokens": 7424770.0, + "step": 3180 + }, + { + "epoch": 7.911581569115816, + "eval_entropy": 0.25416371157003004, + "eval_loss": 0.8206402063369751, + "eval_mean_token_accuracy": 0.852779901651449, + "eval_num_tokens": 7424770.0, + "eval_runtime": 86.1015, + "eval_samples_per_second": 15.97, + "eval_steps_per_second": 1.998, + "step": 3180 + }, + { + "entropy": 0.1395680439658463, + "epoch": 7.961394769613948, + "grad_norm": 0.3809775412082672, + "learning_rate": 2.7552598517312256e-05, + "loss": 0.07236042022705078, + "mean_token_accuracy": 0.9731538116931915, + "num_tokens": 7470804.0, + "step": 3200 + }, + { + "epoch": 7.961394769613948, + "eval_entropy": 0.25528111975899964, + "eval_loss": 0.8230037093162537, + "eval_mean_token_accuracy": 0.8526452603035195, + "eval_num_tokens": 7470804.0, + "eval_runtime": 85.7895, + "eval_samples_per_second": 16.028, + "eval_steps_per_second": 2.005, + "step": 3200 + }, + { + "entropy": 0.12193699864049752, + "epoch": 8.009962640099626, + "grad_norm": 0.11854425817728043, + "learning_rate": 2.6280516564542205e-05, + "loss": 0.06617764234542847, + "mean_token_accuracy": 0.977179691577569, + "num_tokens": 7518110.0, + "step": 3220 + }, + { + "epoch": 8.009962640099626, + "eval_entropy": 0.25100527677771656, + "eval_loss": 0.8393343687057495, + "eval_mean_token_accuracy": 0.8522553132023922, + "eval_num_tokens": 7518110.0, + "eval_runtime": 85.8837, + "eval_samples_per_second": 16.01, + "eval_steps_per_second": 2.003, + "step": 3220 + }, + { + "entropy": 0.12788885813206435, + "epoch": 8.059775840597759, + "grad_norm": 0.16094881296157837, + "learning_rate": 2.50346301653812e-05, + "loss": 0.06274186968803405, + "mean_token_accuracy": 0.9766994707286358, + "num_tokens": 7565539.0, + "step": 3240 + }, + { + "epoch": 8.059775840597759, + "eval_entropy": 0.24409458682287571, + "eval_loss": 0.874617338180542, + "eval_mean_token_accuracy": 0.8521041180505309, + "eval_num_tokens": 7565539.0, + "eval_runtime": 86.2656, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 3240 + }, + { + "entropy": 0.12464155335910618, + "epoch": 8.10958904109589, + "grad_norm": 0.16893954575061798, + "learning_rate": 2.381531506217437e-05, + "loss": 0.06093020439147949, + "mean_token_accuracy": 0.9776258453726768, + "num_tokens": 7612578.0, + "step": 3260 + }, + { + "epoch": 8.10958904109589, + "eval_entropy": 0.24396493017326953, + "eval_loss": 0.891161322593689, + "eval_mean_token_accuracy": 0.8515338024427724, + "eval_num_tokens": 7612578.0, + "eval_runtime": 85.9061, + "eval_samples_per_second": 16.006, + "eval_steps_per_second": 2.002, + "step": 3260 + }, + { + "entropy": 0.12345920228399336, + "epoch": 8.159402241594023, + "grad_norm": 0.14332273602485657, + "learning_rate": 2.262293898372616e-05, + "loss": 0.061289966106414795, + "mean_token_accuracy": 0.9762230902910233, + "num_tokens": 7660157.0, + "step": 3280 + }, + { + "epoch": 8.159402241594023, + "eval_entropy": 0.2481445314059424, + "eval_loss": 0.8922848105430603, + "eval_mean_token_accuracy": 0.8514944855556932, + "eval_num_tokens": 7660157.0, + "eval_runtime": 85.5201, + "eval_samples_per_second": 16.078, + "eval_steps_per_second": 2.011, + "step": 3280 + }, + { + "entropy": 0.12298110066913068, + "epoch": 8.209215442092155, + "grad_norm": 0.21848882734775543, + "learning_rate": 2.1457861534398633e-05, + "loss": 0.05986443758010864, + "mean_token_accuracy": 0.9786281704902648, + "num_tokens": 7709745.0, + "step": 3300 + }, + { + "epoch": 8.209215442092155, + "eval_entropy": 0.24329388124305149, + "eval_loss": 0.9021085500717163, + "eval_mean_token_accuracy": 0.8521762625422589, + "eval_num_tokens": 7709745.0, + "eval_runtime": 85.955, + "eval_samples_per_second": 15.997, + "eval_steps_per_second": 2.001, + "step": 3300 + }, + { + "entropy": 0.13265180448070168, + "epoch": 8.259028642590286, + "grad_norm": 0.18067947030067444, + "learning_rate": 2.0320434085659692e-05, + "loss": 0.06724961400032044, + "mean_token_accuracy": 0.975098168104887, + "num_tokens": 7753571.0, + "step": 3320 + }, + { + "epoch": 8.259028642590286, + "eval_entropy": 0.2433211464694766, + "eval_loss": 0.9094350337982178, + "eval_mean_token_accuracy": 0.8520150094531304, + "eval_num_tokens": 7753571.0, + "eval_runtime": 85.7989, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.005, + "step": 3320 + }, + { + "entropy": 0.11949320202693343, + "epoch": 8.308841843088418, + "grad_norm": 0.17020289599895477, + "learning_rate": 1.9210999670114196e-05, + "loss": 0.0634455680847168, + "mean_token_accuracy": 0.9771294385194779, + "num_tokens": 7799310.0, + "step": 3340 + }, + { + "epoch": 8.308841843088418, + "eval_entropy": 0.24345201219237128, + "eval_loss": 0.9021793603897095, + "eval_mean_token_accuracy": 0.8520745697409607, + "eval_num_tokens": 7799310.0, + "eval_runtime": 86.0883, + "eval_samples_per_second": 15.972, + "eval_steps_per_second": 1.998, + "step": 3340 + }, + { + "entropy": 0.12065747743472457, + "epoch": 8.35865504358655, + "grad_norm": 0.16789060831069946, + "learning_rate": 1.8129892878049886e-05, + "loss": 0.061494195461273195, + "mean_token_accuracy": 0.9779584899544715, + "num_tokens": 7846447.0, + "step": 3360 + }, + { + "epoch": 8.35865504358655, + "eval_entropy": 0.24093415042342142, + "eval_loss": 0.9006755352020264, + "eval_mean_token_accuracy": 0.852174230786257, + "eval_num_tokens": 7846447.0, + "eval_runtime": 85.9011, + "eval_samples_per_second": 16.007, + "eval_steps_per_second": 2.002, + "step": 3360 + }, + { + "entropy": 0.13125578537583352, + "epoch": 8.408468244084682, + "grad_norm": 0.1662452220916748, + "learning_rate": 1.70774397565298e-05, + "loss": 0.06685600876808166, + "mean_token_accuracy": 0.9744067586958408, + "num_tokens": 7890283.0, + "step": 3380 + }, + { + "epoch": 8.408468244084682, + "eval_entropy": 0.24062153688350388, + "eval_loss": 0.9078915119171143, + "eval_mean_token_accuracy": 0.8523201647886011, + "eval_num_tokens": 7890283.0, + "eval_runtime": 86.0201, + "eval_samples_per_second": 15.985, + "eval_steps_per_second": 2.0, + "step": 3380 + }, + { + "entropy": 0.11986117120832204, + "epoch": 8.458281444582815, + "grad_norm": 0.19571948051452637, + "learning_rate": 1.6053957711060606e-05, + "loss": 0.06411095261573792, + "mean_token_accuracy": 0.9770627245306969, + "num_tokens": 7936518.0, + "step": 3400 + }, + { + "epoch": 8.458281444582815, + "eval_entropy": 0.24352820347561394, + "eval_loss": 0.9058943390846252, + "eval_mean_token_accuracy": 0.8519382792156797, + "eval_num_tokens": 7936518.0, + "eval_runtime": 85.966, + "eval_samples_per_second": 15.995, + "eval_steps_per_second": 2.001, + "step": 3400 + }, + { + "entropy": 0.12857897616922856, + "epoch": 8.508094645080947, + "grad_norm": 0.2609264850616455, + "learning_rate": 1.5059755409867613e-05, + "loss": 0.06473397612571716, + "mean_token_accuracy": 0.9764650195837021, + "num_tokens": 7981966.0, + "step": 3420 + }, + { + "epoch": 8.508094645080947, + "eval_entropy": 0.24032609000108962, + "eval_loss": 0.9077776074409485, + "eval_mean_token_accuracy": 0.8517829197090726, + "eval_num_tokens": 7981966.0, + "eval_runtime": 86.6059, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 3420 + }, + { + "entropy": 0.12348870886489749, + "epoch": 8.557907845579079, + "grad_norm": 0.19537609815597534, + "learning_rate": 1.409513269080473e-05, + "loss": 0.06481348872184753, + "mean_token_accuracy": 0.9769559659063816, + "num_tokens": 8028367.0, + "step": 3440 + }, + { + "epoch": 8.557907845579079, + "eval_entropy": 0.2404322574824788, + "eval_loss": 0.9057720899581909, + "eval_mean_token_accuracy": 0.8521037981953732, + "eval_num_tokens": 8028367.0, + "eval_runtime": 86.166, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.996, + "step": 3440 + }, + { + "entropy": 0.12040232736617326, + "epoch": 8.607721046077211, + "grad_norm": 0.3310582935810089, + "learning_rate": 1.3160380470927183e-05, + "loss": 0.06468871235847473, + "mean_token_accuracy": 0.9768650442361831, + "num_tokens": 8074934.0, + "step": 3460 + }, + { + "epoch": 8.607721046077211, + "eval_entropy": 0.24118655876711356, + "eval_loss": 0.9028318524360657, + "eval_mean_token_accuracy": 0.8521025340224422, + "eval_num_tokens": 8074934.0, + "eval_runtime": 85.3668, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.015, + "step": 3460 + }, + { + "entropy": 0.12328103906475008, + "epoch": 8.657534246575342, + "grad_norm": 0.12836167216300964, + "learning_rate": 1.2255780658755122e-05, + "loss": 0.06229386329650879, + "mean_token_accuracy": 0.9763277888298034, + "num_tokens": 8122775.0, + "step": 3480 + }, + { + "epoch": 8.657534246575342, + "eval_entropy": 0.24194598145956217, + "eval_loss": 0.9009329080581665, + "eval_mean_token_accuracy": 0.8521693289973015, + "eval_num_tokens": 8122775.0, + "eval_runtime": 85.9415, + "eval_samples_per_second": 15.999, + "eval_steps_per_second": 2.001, + "step": 3480 + }, + { + "entropy": 0.11321646976284683, + "epoch": 8.707347447073474, + "grad_norm": 0.15656894445419312, + "learning_rate": 1.1381606069253786e-05, + "loss": 0.05908188819885254, + "mean_token_accuracy": 0.9779504477977753, + "num_tokens": 8174307.0, + "step": 3500 + }, + { + "epoch": 8.707347447073474, + "eval_entropy": 0.24121542517528977, + "eval_loss": 0.9016091823577881, + "eval_mean_token_accuracy": 0.8521790667328724, + "eval_num_tokens": 8174307.0, + "eval_runtime": 85.7465, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.006, + "step": 3500 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.4516307630391706e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3520/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3520/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3520/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3520/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3520/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3520/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3520/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3520/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3520/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3520/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3520/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3520/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3520/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3520/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..4d77329a279c6d01c0873cfd431d5c144114c73a --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3520/trainer_state.json @@ -0,0 +1,3730 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 8.757160647571606, + "eval_steps": 20, + "global_step": 3520, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + }, + { + "entropy": 0.561330484598875, + "epoch": 1.891656288916563, + "grad_norm": 0.6722865700721741, + "learning_rate": 0.0002208867897174789, + "loss": 0.499837589263916, + "mean_token_accuracy": 0.8518734864890576, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.5865232653396074, + "eval_loss": 0.5437926650047302, + "eval_mean_token_accuracy": 0.8450997017843779, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4116, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.547389242425561, + "epoch": 1.9414694894146949, + "grad_norm": 0.7935577034950256, + "learning_rate": 0.00022027119820226907, + "loss": 0.4977591514587402, + "mean_token_accuracy": 0.8539491161704064, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.5290903090391048, + "eval_loss": 0.5409526824951172, + "eval_mean_token_accuracy": 0.8497545698354411, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.7262, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 780 + }, + { + "entropy": 0.5687909748405218, + "epoch": 1.9912826899128269, + "grad_norm": 0.6180546283721924, + "learning_rate": 0.00021962329729698345, + "loss": 0.5109643459320068, + "mean_token_accuracy": 0.8521598495543004, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.5503541858390321, + "eval_loss": 0.5361555218696594, + "eval_mean_token_accuracy": 0.8510884285666221, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.3339, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 800 + }, + { + "entropy": 0.4739728841261986, + "epoch": 2.0398505603985058, + "grad_norm": 0.8058829307556152, + "learning_rate": 0.0002189432823996982, + "loss": 0.4204097747802734, + "mean_token_accuracy": 0.8728981889211215, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.5077334992414297, + "eval_loss": 0.5531114339828491, + "eval_mean_token_accuracy": 0.8489257208136625, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.4801, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.989, + "step": 820 + }, + { + "entropy": 0.4594309840351343, + "epoch": 2.0896637608966375, + "grad_norm": 0.6906896829605103, + "learning_rate": 0.0002182313585936314, + "loss": 0.4071959495544434, + "mean_token_accuracy": 0.8732857562601566, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.49850136994622474, + "eval_loss": 0.5486204624176025, + "eval_mean_token_accuracy": 0.8507991450470548, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.3364, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.4881629109382629, + "epoch": 2.1394769613947697, + "grad_norm": 0.6343470215797424, + "learning_rate": 0.0002174877405852928, + "loss": 0.41669540405273436, + "mean_token_accuracy": 0.8711295068264008, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.49155513924914734, + "eval_loss": 0.555109441280365, + "eval_mean_token_accuracy": 0.8496399400539176, + "eval_num_tokens": 2008562.0, + "eval_runtime": 86.3295, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 860 + }, + { + "entropy": 0.4648668970912695, + "epoch": 2.1892901618929015, + "grad_norm": 0.8014165163040161, + "learning_rate": 0.00021671265263973133, + "loss": 0.4110250473022461, + "mean_token_accuracy": 0.8754166305065155, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.4909258722219356, + "eval_loss": 0.5539511442184448, + "eval_mean_token_accuracy": 0.8492401502160138, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.3468, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 880 + }, + { + "entropy": 0.4824485514312983, + "epoch": 2.2391033623910337, + "grad_norm": 0.6665191054344177, + "learning_rate": 0.00021590632851289967, + "loss": 0.4181404113769531, + "mean_token_accuracy": 0.8726993151009083, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.4986876940657926, + "eval_loss": 0.547695517539978, + "eval_mean_token_accuracy": 0.8501384708770486, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.3838, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 900 + }, + { + "entropy": 0.4751896943897009, + "epoch": 2.2889165628891655, + "grad_norm": 0.81158047914505, + "learning_rate": 0.00021506901138115678, + "loss": 0.40689678192138673, + "mean_token_accuracy": 0.8745221219956875, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.507153491121392, + "eval_loss": 0.5501641631126404, + "eval_mean_token_accuracy": 0.8495670116918032, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.0912, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 920 + }, + { + "entropy": 0.4873133715242147, + "epoch": 2.3387297633872977, + "grad_norm": 0.7218056321144104, + "learning_rate": 0.0002142009537679292, + "loss": 0.42701358795166017, + "mean_token_accuracy": 0.8695114746689796, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5202612736543943, + "eval_loss": 0.5491839051246643, + "eval_mean_token_accuracy": 0.8494071208460386, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.1142, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 940 + }, + { + "entropy": 0.4762951169162989, + "epoch": 2.3885429638854294, + "grad_norm": 0.7194424867630005, + "learning_rate": 0.0002133024174675534, + "loss": 0.42299847602844237, + "mean_token_accuracy": 0.8709790132939815, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4899340462546016, + "eval_loss": 0.5522511601448059, + "eval_mean_token_accuracy": 0.8492208258357159, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.463, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 960 + }, + { + "entropy": 0.49650347977876663, + "epoch": 2.4383561643835616, + "grad_norm": 0.8406022787094116, + "learning_rate": 0.0002123736734663221, + "loss": 0.4275330066680908, + "mean_token_accuracy": 0.8670595556497573, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.49691385654515996, + "eval_loss": 0.5491269826889038, + "eval_mean_token_accuracy": 0.850309816210769, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.17, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 980 + }, + { + "entropy": 0.48843890577554705, + "epoch": 2.488169364881694, + "grad_norm": 0.9082473516464233, + "learning_rate": 0.00021141500186075868, + "loss": 0.4309722423553467, + "mean_token_accuracy": 0.8686766296625137, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5543508351195691, + "eval_loss": 0.5478800535202026, + "eval_mean_token_accuracy": 0.8478029522784921, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.3835, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 1000 + }, + { + "entropy": 0.4777219031006098, + "epoch": 2.5379825653798256, + "grad_norm": 0.7448089122772217, + "learning_rate": 0.0002104266917731438, + "loss": 0.423325252532959, + "mean_token_accuracy": 0.8706337086856365, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.49857561550168106, + "eval_loss": 0.5511948466300964, + "eval_mean_token_accuracy": 0.8502220289651737, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.5399, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.988, + "step": 1020 + }, + { + "entropy": 0.4844174191355705, + "epoch": 2.587795765877958, + "grad_norm": 0.794029176235199, + "learning_rate": 0.00020940904126432, + "loss": 0.4176753044128418, + "mean_token_accuracy": 0.873535567522049, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.485467542222766, + "eval_loss": 0.5539286732673645, + "eval_mean_token_accuracy": 0.8495475081510322, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.135, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 1.997, + "step": 1040 + }, + { + "entropy": 0.49070929251611234, + "epoch": 2.6376089663760895, + "grad_norm": 0.7558256983757019, + "learning_rate": 0.0002083623572438007, + "loss": 0.42867293357849123, + "mean_token_accuracy": 0.8696666076779366, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.490822730889154, + "eval_loss": 0.5434785485267639, + "eval_mean_token_accuracy": 0.850568296950917, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.4933, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 1060 + }, + { + "entropy": 0.47806114703416824, + "epoch": 2.6874221668742218, + "grad_norm": 0.6608979105949402, + "learning_rate": 0.00020728695537721047, + "loss": 0.4289727687835693, + "mean_token_accuracy": 0.8693130135536193, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.5285773256490397, + "eval_loss": 0.5444230437278748, + "eval_mean_token_accuracy": 0.8498796481032704, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.7091, + "eval_samples_per_second": 15.858, + "eval_steps_per_second": 1.984, + "step": 1080 + }, + { + "entropy": 0.5046216730028391, + "epoch": 2.7372353673723535, + "grad_norm": 0.8428544998168945, + "learning_rate": 0.00020618315999108454, + "loss": 0.43131070137023925, + "mean_token_accuracy": 0.8701941035687923, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.49888394738352576, + "eval_loss": 0.5459766387939453, + "eval_mean_token_accuracy": 0.8511758872935938, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.2222, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.995, + "step": 1100 + }, + { + "entropy": 0.5212558470666409, + "epoch": 2.7870485678704857, + "grad_norm": 1.129318118095398, + "learning_rate": 0.00020505130397505635, + "loss": 0.44249300956726073, + "mean_token_accuracy": 0.8654101334512234, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5179622324053631, + "eval_loss": 0.5522801280021667, + "eval_mean_token_accuracy": 0.8497019947268242, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.1903, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.996, + "step": 1120 + }, + { + "entropy": 0.4988406613469124, + "epoch": 2.8368617683686175, + "grad_norm": 0.6460545063018799, + "learning_rate": 0.00020389172868146263, + "loss": 0.4386270523071289, + "mean_token_accuracy": 0.8690383620560169, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.5042278484203094, + "eval_loss": 0.5433034300804138, + "eval_mean_token_accuracy": 0.8497674451317898, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.3028, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.993, + "step": 1140 + }, + { + "entropy": 0.4926559619605541, + "epoch": 2.8866749688667497, + "grad_norm": 0.8199329972267151, + "learning_rate": 0.00020270478382239615, + "loss": 0.4313485145568848, + "mean_token_accuracy": 0.8674727231264114, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.503873193160046, + "eval_loss": 0.5388111472129822, + "eval_mean_token_accuracy": 0.8526195034731266, + "eval_num_tokens": 2710196.0, + "eval_runtime": 86.4054, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.991, + "step": 1160 + }, + { + "entropy": 0.5020013231784105, + "epoch": 2.936488169364882, + "grad_norm": 0.7344821095466614, + "learning_rate": 0.00020149082736423723, + "loss": 0.43590536117553713, + "mean_token_accuracy": 0.8671772189438343, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5368241809828337, + "eval_loss": 0.5355703830718994, + "eval_mean_token_accuracy": 0.8517617773871089, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.2945, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1180 + }, + { + "entropy": 0.5112275708466768, + "epoch": 2.9863013698630136, + "grad_norm": 0.6951606869697571, + "learning_rate": 0.00020025022541969622, + "loss": 0.43579301834106443, + "mean_token_accuracy": 0.8641206480562686, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.5066795706055885, + "eval_loss": 0.5415249466896057, + "eval_mean_token_accuracy": 0.8493563373421513, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.5005, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.988, + "step": 1200 + }, + { + "entropy": 0.42298635305502474, + "epoch": 3.0348692403486925, + "grad_norm": 0.8201794028282166, + "learning_rate": 0.00019898335213739863, + "loss": 0.35593905448913576, + "mean_token_accuracy": 0.889238600547497, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.4584170470750609, + "eval_loss": 0.569487452507019, + "eval_mean_token_accuracy": 0.8495814173027526, + "eval_num_tokens": 2848509.0, + "eval_runtime": 86.2281, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 1220 + }, + { + "entropy": 0.37450140453875064, + "epoch": 3.0846824408468243, + "grad_norm": 0.7308394908905029, + "learning_rate": 0.0001976905895890471, + "loss": 0.307823920249939, + "mean_token_accuracy": 0.9001288741827012, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.45185995916294497, + "eval_loss": 0.5672881603240967, + "eval_mean_token_accuracy": 0.8511318519364955, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.0819, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.998, + "step": 1240 + }, + { + "entropy": 0.3887945845723152, + "epoch": 3.1344956413449565, + "grad_norm": 0.7299330830574036, + "learning_rate": 0.0001963723276541939, + "loss": 0.32047903537750244, + "mean_token_accuracy": 0.8960984498262405, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.44865354549053105, + "eval_loss": 0.5666037201881409, + "eval_mean_token_accuracy": 0.8496572649063066, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 1260 + }, + { + "entropy": 0.39677664265036583, + "epoch": 3.1843088418430883, + "grad_norm": 0.9533219933509827, + "learning_rate": 0.00019502896390265838, + "loss": 0.3253983497619629, + "mean_token_accuracy": 0.8964207418262958, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.4641980809527774, + "eval_loss": 0.5814996957778931, + "eval_mean_token_accuracy": 0.8485886212005171, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.7784, + "eval_samples_per_second": 15.845, + "eval_steps_per_second": 1.982, + "step": 1280 + }, + { + "entropy": 0.39210722744464876, + "epoch": 3.2341220423412205, + "grad_norm": 0.7447651028633118, + "learning_rate": 0.00019366090347462545, + "loss": 0.3276803970336914, + "mean_token_accuracy": 0.8930055953562259, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43595615254585135, + "eval_loss": 0.5722188353538513, + "eval_mean_token_accuracy": 0.8501105755567551, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.5271, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 1300 + }, + { + "entropy": 0.3684127271175385, + "epoch": 3.2839352428393527, + "grad_norm": 0.6934201121330261, + "learning_rate": 0.00019226855895846078, + "loss": 0.3156379222869873, + "mean_token_accuracy": 0.8976306475698947, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.4628148723480313, + "eval_loss": 0.5631352066993713, + "eval_mean_token_accuracy": 0.8504934813394103, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.3436, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 1320 + }, + { + "entropy": 0.4073401909321547, + "epoch": 3.3337484433374844, + "grad_norm": 0.9386897683143616, + "learning_rate": 0.00019085235026627994, + "loss": 0.34265310764312745, + "mean_token_accuracy": 0.8902062118053437, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.46455050623694133, + "eval_loss": 0.5586736798286438, + "eval_mean_token_accuracy": 0.8506874702004499, + "eval_num_tokens": 3132874.0, + "eval_runtime": 86.1286, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.997, + "step": 1340 + }, + { + "entropy": 0.4046429242938757, + "epoch": 3.383561643835616, + "grad_norm": 0.9633992314338684, + "learning_rate": 0.00018941270450730836, + "loss": 0.33816893100738527, + "mean_token_accuracy": 0.8927541889250279, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.46846531660750856, + "eval_loss": 0.561501681804657, + "eval_mean_token_accuracy": 0.8496256377114806, + "eval_num_tokens": 3178055.0, + "eval_runtime": 86.685, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1360 + }, + { + "entropy": 0.39872407019138334, + "epoch": 3.4333748443337484, + "grad_norm": 0.7786458730697632, + "learning_rate": 0.00018795005585907113, + "loss": 0.33342490196228025, + "mean_token_accuracy": 0.8944805048406124, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.42709505973860273, + "eval_loss": 0.5751848220825195, + "eval_mean_token_accuracy": 0.8507290447867194, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.6892, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 1380 + }, + { + "entropy": 0.3923338124528527, + "epoch": 3.4831880448318806, + "grad_norm": 0.9305956363677979, + "learning_rate": 0.0001864648454364511, + "loss": 0.33188116550445557, + "mean_token_accuracy": 0.8943330392241478, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.4386174779298694, + "eval_loss": 0.5680831074714661, + "eval_mean_token_accuracy": 0.8513129727784977, + "eval_num_tokens": 3274096.0, + "eval_runtime": 86.2671, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 1400 + }, + { + "entropy": 0.3856233984231949, + "epoch": 3.5330012453300124, + "grad_norm": 1.0362752676010132, + "learning_rate": 0.0001849575211586545, + "loss": 0.33098697662353516, + "mean_token_accuracy": 0.8961390435695649, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4574795474493226, + "eval_loss": 0.5630439519882202, + "eval_mean_token_accuracy": 0.8520988873964133, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.6035, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 1420 + }, + { + "entropy": 0.39812871962785723, + "epoch": 3.5828144458281446, + "grad_norm": 0.7807195782661438, + "learning_rate": 0.0001834285376141247, + "loss": 0.3333771228790283, + "mean_token_accuracy": 0.8930827379226685, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.4556825893909432, + "eval_loss": 0.5689062476158142, + "eval_mean_token_accuracy": 0.8507103507601937, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.1606, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.996, + "step": 1440 + }, + { + "entropy": 0.4147744856774807, + "epoch": 3.6326276463262763, + "grad_norm": 0.6429352164268494, + "learning_rate": 0.00018187835592344443, + "loss": 0.3482560873031616, + "mean_token_accuracy": 0.8910200245678425, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.46600024540757023, + "eval_loss": 0.5609709024429321, + "eval_mean_token_accuracy": 0.8491220876227977, + "eval_num_tokens": 3415600.0, + "eval_runtime": 86.8039, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1460 + }, + { + "entropy": 0.40425071083009245, + "epoch": 3.6824408468244085, + "grad_norm": 0.8613698482513428, + "learning_rate": 0.0001803074436002682, + "loss": 0.342916464805603, + "mean_token_accuracy": 0.8916418336331844, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.43855057899342026, + "eval_loss": 0.5720968246459961, + "eval_mean_token_accuracy": 0.8500823641932288, + "eval_num_tokens": 3460471.0, + "eval_runtime": 86.6746, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1480 + }, + { + "entropy": 0.39465143866837027, + "epoch": 3.7322540473225407, + "grad_norm": 0.6285189986228943, + "learning_rate": 0.0001787162744103265, + "loss": 0.3424591779708862, + "mean_token_accuracy": 0.8906558901071548, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4509461877304454, + "eval_loss": 0.5590082406997681, + "eval_mean_token_accuracy": 0.8511747371318729, + "eval_num_tokens": 3507647.0, + "eval_runtime": 86.8126, + "eval_samples_per_second": 15.839, + "eval_steps_per_second": 1.981, + "step": 1500 + }, + { + "entropy": 0.4021005939692259, + "epoch": 3.7820672478206725, + "grad_norm": 0.8821248412132263, + "learning_rate": 0.00017710532822854468, + "loss": 0.3462103843688965, + "mean_token_accuracy": 0.889109355956316, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.4502199075596277, + "eval_loss": 0.566046416759491, + "eval_mean_token_accuracy": 0.8501714208098345, + "eval_num_tokens": 3548934.0, + "eval_runtime": 86.8336, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.981, + "step": 1520 + }, + { + "entropy": 0.4017397932708263, + "epoch": 3.8318804483188043, + "grad_norm": 0.8400952816009521, + "learning_rate": 0.0001754750908943189, + "loss": 0.34890995025634763, + "mean_token_accuracy": 0.8892098367214203, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.4614003023435903, + "eval_loss": 0.5617933869361877, + "eval_mean_token_accuracy": 0.8515863616106122, + "eval_num_tokens": 3597186.0, + "eval_runtime": 86.4609, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 1540 + }, + { + "entropy": 0.4112051840871572, + "epoch": 3.8816936488169365, + "grad_norm": 0.769478440284729, + "learning_rate": 0.0001738260540649939, + "loss": 0.34711437225341796, + "mean_token_accuracy": 0.8911717928946018, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4540443811998811, + "eval_loss": 0.5576469898223877, + "eval_mean_token_accuracy": 0.8512079674144124, + "eval_num_tokens": 3646646.0, + "eval_runtime": 86.5103, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 1560 + }, + { + "entropy": 0.41105241514742374, + "epoch": 3.9315068493150687, + "grad_norm": 0.8468427062034607, + "learning_rate": 0.00017215871506758568, + "loss": 0.3433023452758789, + "mean_token_accuracy": 0.8898739732801915, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.4707539707075718, + "eval_loss": 0.5641466379165649, + "eval_mean_token_accuracy": 0.8495440957851188, + "eval_num_tokens": 3689560.0, + "eval_runtime": 86.609, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.986, + "step": 1580 + }, + { + "entropy": 0.41016379147768023, + "epoch": 3.9813200498132004, + "grad_norm": 0.7482675313949585, + "learning_rate": 0.0001704735767487946, + "loss": 0.34550890922546384, + "mean_token_accuracy": 0.8893028847873211, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.46391099864660307, + "eval_loss": 0.5593640804290771, + "eval_mean_token_accuracy": 0.8510130581467651, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.3975, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 1600 + }, + { + "entropy": 0.33167599791135544, + "epoch": 4.029887920298879, + "grad_norm": 0.9435692429542542, + "learning_rate": 0.00016877114732335337, + "loss": 0.2716026544570923, + "mean_token_accuracy": 0.9133149828666296, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.38499350005457567, + "eval_loss": 0.6298249363899231, + "eval_mean_token_accuracy": 0.8488117071778275, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.2933, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1620 + }, + { + "entropy": 0.3000166634097695, + "epoch": 4.0797011207970115, + "grad_norm": 0.8080845475196838, + "learning_rate": 0.0001670519402207569, + "loss": 0.22617182731628419, + "mean_token_accuracy": 0.9253474645316601, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.370110988703578, + "eval_loss": 0.6338461637496948, + "eval_mean_token_accuracy": 0.8485634801692741, + "eval_num_tokens": 3828830.0, + "eval_runtime": 85.9508, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.001, + "step": 1640 + }, + { + "entropy": 0.2986910421401262, + "epoch": 4.129514321295143, + "grad_norm": 0.7310900092124939, + "learning_rate": 0.0001653164739304185, + "loss": 0.22367463111877442, + "mean_token_accuracy": 0.9252275295555592, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.3944379702037157, + "eval_loss": 0.6109381914138794, + "eval_mean_token_accuracy": 0.849291454220927, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.6728, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1660 + }, + { + "entropy": 0.3095553796738386, + "epoch": 4.179327521793275, + "grad_norm": 0.7059140801429749, + "learning_rate": 0.0001635652718453007, + "loss": 0.23651680946350098, + "mean_token_accuracy": 0.9208931416273117, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.3910588648949945, + "eval_loss": 0.6104469299316406, + "eval_mean_token_accuracy": 0.8486883893262508, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7612, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.982, + "step": 1680 + }, + { + "entropy": 0.3001101028174162, + "epoch": 4.229140722291407, + "grad_norm": 0.6787802577018738, + "learning_rate": 0.00016179886210406728, + "loss": 0.23130471706390382, + "mean_token_accuracy": 0.9233332790434361, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3794369170832079, + "eval_loss": 0.6182110905647278, + "eval_mean_token_accuracy": 0.8495433777570724, + "eval_num_tokens": 3967474.0, + "eval_runtime": 85.94, + "eval_samples_per_second": 16.0, + "eval_steps_per_second": 2.001, + "step": 1700 + }, + { + "entropy": 0.3031421799212694, + "epoch": 4.2789539227895395, + "grad_norm": 0.9732038378715515, + "learning_rate": 0.0001600177774318036, + "loss": 0.2359529733657837, + "mean_token_accuracy": 0.9217648565769195, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3923123094231583, + "eval_loss": 0.6057384610176086, + "eval_mean_token_accuracy": 0.8508818288182103, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7647, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.29365369994193313, + "epoch": 4.328767123287671, + "grad_norm": 0.7681498527526855, + "learning_rate": 0.0001582225549793541, + "loss": 0.2269371747970581, + "mean_token_accuracy": 0.9245341829955578, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.4011661055129628, + "eval_loss": 0.6144486665725708, + "eval_mean_token_accuracy": 0.8480324357054955, + "eval_num_tokens": 4062594.0, + "eval_runtime": 87.1306, + "eval_samples_per_second": 15.781, + "eval_steps_per_second": 1.974, + "step": 1740 + }, + { + "entropy": 0.29396994728595016, + "epoch": 4.378580323785803, + "grad_norm": 1.0001007318496704, + "learning_rate": 0.0001564137361613248, + "loss": 0.22777395248413085, + "mean_token_accuracy": 0.9262309700250626, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38518730195802314, + "eval_loss": 0.6202630400657654, + "eval_mean_token_accuracy": 0.8493869807137999, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6616, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.3096018506214023, + "epoch": 4.428393524283935, + "grad_norm": 1.0448365211486816, + "learning_rate": 0.00015459186649280024, + "loss": 0.23696351051330566, + "mean_token_accuracy": 0.9217322513461113, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.3946371126140273, + "eval_loss": 0.6079026460647583, + "eval_mean_token_accuracy": 0.8492515852978063, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6582, + "eval_samples_per_second": 15.867, + "eval_steps_per_second": 1.985, + "step": 1780 + }, + { + "entropy": 0.32619857545942066, + "epoch": 4.478206724782067, + "grad_norm": 0.7210651636123657, + "learning_rate": 0.00015275749542482337, + "loss": 0.24651215076446534, + "mean_token_accuracy": 0.9177676141262054, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.3947690814560236, + "eval_loss": 0.6065912246704102, + "eval_mean_token_accuracy": 0.8502957744653835, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.5959, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.986, + "step": 1800 + }, + { + "entropy": 0.3193941755220294, + "epoch": 4.5280199252802, + "grad_norm": 0.8281906843185425, + "learning_rate": 0.0001509111761786888, + "loss": 0.23936262130737304, + "mean_token_accuracy": 0.9201708927750587, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38704028864239537, + "eval_loss": 0.6006569266319275, + "eval_mean_token_accuracy": 0.8502406720505205, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.8059, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1820 + }, + { + "entropy": 0.3164879363030195, + "epoch": 4.577833125778331, + "grad_norm": 0.7892968654632568, + "learning_rate": 0.00014905346557909867, + "loss": 0.24541733264923096, + "mean_token_accuracy": 0.9175932116806507, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.38861122120951497, + "eval_loss": 0.6115967631340027, + "eval_mean_token_accuracy": 0.849471275196519, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.2946, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1840 + }, + { + "entropy": 0.3051785985007882, + "epoch": 4.627646326276463, + "grad_norm": 0.8109654188156128, + "learning_rate": 0.0001471849238862319, + "loss": 0.23433220386505127, + "mean_token_accuracy": 0.9206570319831371, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.37162452295076015, + "eval_loss": 0.6184061765670776, + "eval_mean_token_accuracy": 0.8501173268223918, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.6865, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1860 + }, + { + "entropy": 0.3168198253959417, + "epoch": 4.677459526774595, + "grad_norm": 0.9512342214584351, + "learning_rate": 0.0001453061146267775, + "loss": 0.23832404613494873, + "mean_token_accuracy": 0.9197044663131237, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3845940856912801, + "eval_loss": 0.606762707233429, + "eval_mean_token_accuracy": 0.8504838194957999, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.5175, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 1880 + }, + { + "entropy": 0.30791807882487776, + "epoch": 4.7272727272727275, + "grad_norm": 0.8123113512992859, + "learning_rate": 0.00014341760442398248, + "loss": 0.2395785331726074, + "mean_token_accuracy": 0.918928150832653, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.39762327222283494, + "eval_loss": 0.5994202494621277, + "eval_mean_token_accuracy": 0.8509274201337681, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.2873, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.993, + "step": 1900 + }, + { + "entropy": 0.3021434534341097, + "epoch": 4.777085927770859, + "grad_norm": 0.731787383556366, + "learning_rate": 0.000141519962826766, + "loss": 0.23494718074798585, + "mean_token_accuracy": 0.9201403826475143, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.3827026732439219, + "eval_loss": 0.5995895862579346, + "eval_mean_token_accuracy": 0.851468373523202, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.3006, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 1920 + }, + { + "entropy": 0.31626159623265265, + "epoch": 4.826899128268991, + "grad_norm": 0.8848487138748169, + "learning_rate": 0.00013961376213795132, + "loss": 0.2439030647277832, + "mean_token_accuracy": 0.9196575872600079, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.388698436839636, + "eval_loss": 0.6000174283981323, + "eval_mean_token_accuracy": 0.8518068187458571, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.8979, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.979, + "step": 1940 + }, + { + "entropy": 0.30520407035946845, + "epoch": 4.876712328767123, + "grad_norm": 0.8532460927963257, + "learning_rate": 0.00013769957724166695, + "loss": 0.23458616733551024, + "mean_token_accuracy": 0.9221912942826748, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.38777847102908203, + "eval_loss": 0.6004981398582458, + "eval_mean_token_accuracy": 0.8516481768253238, + "eval_num_tokens": 4578167.0, + "eval_runtime": 87.0777, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.975, + "step": 1960 + }, + { + "entropy": 0.3226448342204094, + "epoch": 4.926525529265255, + "grad_norm": 0.6945561766624451, + "learning_rate": 0.0001357779854299694, + "loss": 0.24048397541046143, + "mean_token_accuracy": 0.9195300146937371, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.38581624263247777, + "eval_loss": 0.6029234528541565, + "eval_mean_token_accuracy": 0.8514213260523108, + "eval_num_tokens": 4622316.0, + "eval_runtime": 85.8729, + "eval_samples_per_second": 16.012, + "eval_steps_per_second": 2.003, + "step": 1980 + }, + { + "entropy": 0.3051655298098922, + "epoch": 4.976338729763388, + "grad_norm": 0.7976452708244324, + "learning_rate": 0.00013384956622874001, + "loss": 0.23584742546081544, + "mean_token_accuracy": 0.9216851457953453, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.37913159246361533, + "eval_loss": 0.6057604551315308, + "eval_mean_token_accuracy": 0.8525801203971686, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.1145, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 2000 + }, + { + "entropy": 0.27438195240803254, + "epoch": 5.024906600249066, + "grad_norm": 0.6729586124420166, + "learning_rate": 0.0001319149012229075, + "loss": 0.19775952100753785, + "mean_token_accuracy": 0.9339428559327737, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.3448961910813354, + "eval_loss": 0.6750120520591736, + "eval_mean_token_accuracy": 0.8487970232963562, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.1169, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 2020 + }, + { + "entropy": 0.21423916313797237, + "epoch": 5.074719800747198, + "grad_norm": 0.6934391856193542, + "learning_rate": 0.00012997457388105022, + "loss": 0.1439570426940918, + "mean_token_accuracy": 0.9528236843645572, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.3570949243771475, + "eval_loss": 0.6465504169464111, + "eval_mean_token_accuracy": 0.8490785547467166, + "eval_num_tokens": 4763269.0, + "eval_runtime": 85.9574, + "eval_samples_per_second": 15.996, + "eval_steps_per_second": 2.001, + "step": 2040 + }, + { + "entropy": 0.20838565267622472, + "epoch": 5.12453300124533, + "grad_norm": 0.7286986112594604, + "learning_rate": 0.00012802916937942972, + "loss": 0.14467307329177856, + "mean_token_accuracy": 0.950994835793972, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.3452463157821533, + "eval_loss": 0.6705958843231201, + "eval_mean_token_accuracy": 0.8490352796953778, + "eval_num_tokens": 4809047.0, + "eval_runtime": 86.228, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 2060 + }, + { + "entropy": 0.20453082229942082, + "epoch": 5.174346201743462, + "grad_norm": 0.7515555620193481, + "learning_rate": 0.00012607927442550974, + "loss": 0.13732000589370727, + "mean_token_accuracy": 0.9537357829511166, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.32431264914745506, + "eval_loss": 0.6743043065071106, + "eval_mean_token_accuracy": 0.8504878629085629, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.5948, + "eval_samples_per_second": 15.879, + "eval_steps_per_second": 1.986, + "step": 2080 + }, + { + "entropy": 0.21812320686876774, + "epoch": 5.224159402241594, + "grad_norm": 0.9093465209007263, + "learning_rate": 0.0001241254770810132, + "loss": 0.14311420917510986, + "mean_token_accuracy": 0.9514068141579628, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.33086285835435225, + "eval_loss": 0.6676449179649353, + "eval_mean_token_accuracy": 0.8505287662495015, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 2100 + }, + { + "entropy": 0.2180163251236081, + "epoch": 5.273972602739726, + "grad_norm": 0.6703007221221924, + "learning_rate": 0.00012216836658457075, + "loss": 0.14803968667984008, + "mean_token_accuracy": 0.9521303348243236, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.33162341708707255, + "eval_loss": 0.6658875942230225, + "eval_mean_token_accuracy": 0.8500757605530495, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.6296, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 2120 + }, + { + "entropy": 0.22511130161583423, + "epoch": 5.323785803237858, + "grad_norm": 0.8078880906105042, + "learning_rate": 0.00012020853317401455, + "loss": 0.15228408575057983, + "mean_token_accuracy": 0.947144789993763, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3354601170434508, + "eval_loss": 0.6677829623222351, + "eval_mean_token_accuracy": 0.8482600024273229, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.4689, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.989, + "step": 2140 + }, + { + "entropy": 0.2244176059961319, + "epoch": 5.37359900373599, + "grad_norm": 0.9636075496673584, + "learning_rate": 0.00011824656790837037, + "loss": 0.15260883569717407, + "mean_token_accuracy": 0.9471467643976211, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.3381616926297199, + "eval_loss": 0.6694412231445312, + "eval_mean_token_accuracy": 0.8482369603805764, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.4147, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 2160 + }, + { + "entropy": 0.22982364390045404, + "epoch": 5.423412204234122, + "grad_norm": 0.775401771068573, + "learning_rate": 0.00011628306248960262, + "loss": 0.15140302181243898, + "mean_token_accuracy": 0.9492553934454918, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.3305150235808173, + "eval_loss": 0.6717822551727295, + "eval_mean_token_accuracy": 0.8489849723355715, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.4728, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.989, + "step": 2180 + }, + { + "entropy": 0.21448935717344284, + "epoch": 5.473225404732254, + "grad_norm": 0.6575281023979187, + "learning_rate": 0.00011431860908416465, + "loss": 0.1452319622039795, + "mean_token_accuracy": 0.9505287684500218, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3488145174328671, + "eval_loss": 0.6612305641174316, + "eval_mean_token_accuracy": 0.8492907808963642, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6927, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 2200 + }, + { + "entropy": 0.23091202937066554, + "epoch": 5.523038605230386, + "grad_norm": 0.8909686207771301, + "learning_rate": 0.00011235380014440985, + "loss": 0.15150139331817628, + "mean_token_accuracy": 0.9497875183820724, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.3268539015810157, + "eval_loss": 0.6667542457580566, + "eval_mean_token_accuracy": 0.8499062903398691, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.4644, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 2220 + }, + { + "entropy": 0.2227974807843566, + "epoch": 5.572851805728518, + "grad_norm": 0.6180275082588196, + "learning_rate": 0.0001103892282299158, + "loss": 0.1491069197654724, + "mean_token_accuracy": 0.9488144010305405, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3346347655494546, + "eval_loss": 0.6665948629379272, + "eval_mean_token_accuracy": 0.8499961893918903, + "eval_num_tokens": 5226864.0, + "eval_runtime": 87.0548, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.976, + "step": 2240 + }, + { + "entropy": 0.21368421968072654, + "epoch": 5.62266500622665, + "grad_norm": 0.6004369258880615, + "learning_rate": 0.00010842548582877651, + "loss": 0.14485255479812623, + "mean_token_accuracy": 0.9502056457102299, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.32753298804163933, + "eval_loss": 0.6680151224136353, + "eval_mean_token_accuracy": 0.8515451086121936, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.8524, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.98, + "step": 2260 + }, + { + "entropy": 0.2103635374456644, + "epoch": 5.672478206724782, + "grad_norm": 0.699174702167511, + "learning_rate": 0.00010646316517891613, + "loss": 0.14297772645950318, + "mean_token_accuracy": 0.9512537539005279, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.32966585959806, + "eval_loss": 0.675578773021698, + "eval_mean_token_accuracy": 0.8509623023659684, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.4518, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.99, + "step": 2280 + }, + { + "entropy": 0.22516900151968003, + "epoch": 5.722291407222914, + "grad_norm": 0.6637354493141174, + "learning_rate": 0.00010450285808947797, + "loss": 0.15202572345733642, + "mean_token_accuracy": 0.9482452072203159, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3369456917740578, + "eval_loss": 0.6697061061859131, + "eval_mean_token_accuracy": 0.848603522361711, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.6371, + "eval_samples_per_second": 15.871, + "eval_steps_per_second": 1.985, + "step": 2300 + }, + { + "entropy": 0.21841065725311637, + "epoch": 5.772104607721046, + "grad_norm": 0.7940268516540527, + "learning_rate": 0.00010254515576234297, + "loss": 0.14710167646408082, + "mean_token_accuracy": 0.9493498183786869, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3237486180177955, + "eval_loss": 0.6779657602310181, + "eval_mean_token_accuracy": 0.8500715313955794, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.1826, + "eval_samples_per_second": 15.954, + "eval_steps_per_second": 1.996, + "step": 2320 + }, + { + "entropy": 0.22146204356104135, + "epoch": 5.821917808219178, + "grad_norm": 0.9234833121299744, + "learning_rate": 0.00010059064861383132, + "loss": 0.14720046520233154, + "mean_token_accuracy": 0.9493872679769992, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.32365207564692167, + "eval_loss": 0.6704005002975464, + "eval_mean_token_accuracy": 0.8507985760306203, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.5494, + "eval_samples_per_second": 15.887, + "eval_steps_per_second": 1.987, + "step": 2340 + }, + { + "entropy": 0.20934011954814197, + "epoch": 5.87173100871731, + "grad_norm": 0.5547503232955933, + "learning_rate": 9.863992609664084e-05, + "loss": 0.1464867353439331, + "mean_token_accuracy": 0.9503875687718392, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.3330401429083458, + "eval_loss": 0.6659091114997864, + "eval_mean_token_accuracy": 0.8504848906467127, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.5855, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 2360 + }, + { + "entropy": 0.21678635366261007, + "epoch": 5.921544209215442, + "grad_norm": 0.570612907409668, + "learning_rate": 9.669357652207635e-05, + "loss": 0.14821385145187377, + "mean_token_accuracy": 0.9503940217196941, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3322022325077722, + "eval_loss": 0.6722489595413208, + "eval_mean_token_accuracy": 0.8489979422369669, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.2986, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 2380 + }, + { + "entropy": 0.20932920072227718, + "epoch": 5.971357409713574, + "grad_norm": 0.7879557609558105, + "learning_rate": 9.475218688262262e-05, + "loss": 0.14675841331481934, + "mean_token_accuracy": 0.9507176131010056, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.3199348642902319, + "eval_loss": 0.6698136329650879, + "eval_mean_token_accuracy": 0.8514142130003419, + "eval_num_tokens": 5605400.0, + "eval_runtime": 85.8995, + "eval_samples_per_second": 16.007, + "eval_steps_per_second": 2.002, + "step": 2400 + }, + { + "entropy": 0.21032143919131693, + "epoch": 6.019925280199253, + "grad_norm": 0.5823076367378235, + "learning_rate": 9.281634267491569e-05, + "loss": 0.13322267532348633, + "mean_token_accuracy": 0.9550939072401096, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.30206270117399303, + "eval_loss": 0.7093168497085571, + "eval_mean_token_accuracy": 0.8500627639681794, + "eval_num_tokens": 5648968.0, + "eval_runtime": 85.8128, + "eval_samples_per_second": 16.023, + "eval_steps_per_second": 2.004, + "step": 2420 + }, + { + "entropy": 0.1534628233872354, + "epoch": 6.069738480697385, + "grad_norm": 0.710133969783783, + "learning_rate": 9.088662772316508e-05, + "loss": 0.09078952670097351, + "mean_token_accuracy": 0.9678447999060154, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.28208133101809857, + "eval_loss": 0.7636417150497437, + "eval_mean_token_accuracy": 0.8494061477655588, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9724, + "eval_samples_per_second": 15.994, + "eval_steps_per_second": 2.001, + "step": 2440 + }, + { + "entropy": 0.16151462448760867, + "epoch": 6.119551681195516, + "grad_norm": 0.5793812274932861, + "learning_rate": 8.896362400308028e-05, + "loss": 0.09545697569847107, + "mean_token_accuracy": 0.9671573750674725, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.2833245605403601, + "eval_loss": 0.7402405738830566, + "eval_mean_token_accuracy": 0.8503523728875226, + "eval_num_tokens": 5745090.0, + "eval_runtime": 85.5461, + "eval_samples_per_second": 16.073, + "eval_steps_per_second": 2.011, + "step": 2460 + }, + { + "entropy": 0.15203177919611335, + "epoch": 6.169364881693649, + "grad_norm": 0.4251123368740082, + "learning_rate": 8.704791146635483e-05, + "loss": 0.09420782327651978, + "mean_token_accuracy": 0.9677386932075024, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.28572545962971313, + "eval_loss": 0.735416829586029, + "eval_mean_token_accuracy": 0.8487084663884584, + "eval_num_tokens": 5790333.0, + "eval_runtime": 85.4801, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.012, + "step": 2480 + }, + { + "entropy": 0.15587336672469973, + "epoch": 6.219178082191781, + "grad_norm": 0.4357028007507324, + "learning_rate": 8.514006786576085e-05, + "loss": 0.09429320096969604, + "mean_token_accuracy": 0.9682952925562859, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.2859006894882335, + "eval_loss": 0.7347224950790405, + "eval_mean_token_accuracy": 0.8501905518215757, + "eval_num_tokens": 5837321.0, + "eval_runtime": 85.7578, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.006, + "step": 2500 + }, + { + "entropy": 0.15765639198943973, + "epoch": 6.268991282689913, + "grad_norm": 0.47331130504608154, + "learning_rate": 8.324066858090663e-05, + "loss": 0.09571113586425781, + "mean_token_accuracy": 0.9683481335639954, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.29231513846059176, + "eval_loss": 0.7392512559890747, + "eval_mean_token_accuracy": 0.8486633983462356, + "eval_num_tokens": 5884398.0, + "eval_runtime": 85.7846, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.005, + "step": 2520 + }, + { + "entropy": 0.16176860257983208, + "epoch": 6.318804483188045, + "grad_norm": 0.6142018437385559, + "learning_rate": 8.135028644470992e-05, + "loss": 0.09486144185066223, + "mean_token_accuracy": 0.9682316601276397, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.2851274753379267, + "eval_loss": 0.7520816922187805, + "eval_mean_token_accuracy": 0.8501113649717597, + "eval_num_tokens": 5929876.0, + "eval_runtime": 85.9425, + "eval_samples_per_second": 15.999, + "eval_steps_per_second": 2.001, + "step": 2540 + }, + { + "entropy": 0.15404034564271568, + "epoch": 6.3686176836861765, + "grad_norm": 0.6051287651062012, + "learning_rate": 7.946949157063964e-05, + "loss": 0.09280472993850708, + "mean_token_accuracy": 0.9684635892510414, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28802703563557114, + "eval_loss": 0.7439162135124207, + "eval_mean_token_accuracy": 0.8499851770872293, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.0703, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.998, + "step": 2560 + }, + { + "entropy": 0.15343588953837753, + "epoch": 6.418430884184309, + "grad_norm": 0.4823743402957916, + "learning_rate": 7.759885118077701e-05, + "loss": 0.09000591039657593, + "mean_token_accuracy": 0.9699928767979145, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2795634938533916, + "eval_loss": 0.7647850513458252, + "eval_mean_token_accuracy": 0.8503464397995971, + "eval_num_tokens": 6025380.0, + "eval_runtime": 85.8886, + "eval_samples_per_second": 16.009, + "eval_steps_per_second": 2.003, + "step": 2580 + }, + { + "entropy": 0.15740026142448188, + "epoch": 6.468244084682441, + "grad_norm": 0.5082696676254272, + "learning_rate": 7.57389294347494e-05, + "loss": 0.09191849827766418, + "mean_token_accuracy": 0.9692809768021107, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2913342311458532, + "eval_loss": 0.7518694996833801, + "eval_mean_token_accuracy": 0.8483168302580367, + "eval_num_tokens": 6073349.0, + "eval_runtime": 85.5761, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.01, + "step": 2600 + }, + { + "entropy": 0.15922069251537324, + "epoch": 6.518057285180573, + "grad_norm": 0.3995199501514435, + "learning_rate": 7.389028725958736e-05, + "loss": 0.09584367871284485, + "mean_token_accuracy": 0.9685114495456218, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.2863075934177221, + "eval_loss": 0.7539381384849548, + "eval_mean_token_accuracy": 0.8507507083027862, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.112, + "eval_samples_per_second": 15.968, + "eval_steps_per_second": 1.997, + "step": 2620 + }, + { + "entropy": 0.16197575423866512, + "epoch": 6.567870485678705, + "grad_norm": 0.534295380115509, + "learning_rate": 7.205348218055678e-05, + "loss": 0.0961170256137848, + "mean_token_accuracy": 0.9674530044198036, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.29021967315050057, + "eval_loss": 0.751198947429657, + "eval_mean_token_accuracy": 0.8509796344956686, + "eval_num_tokens": 6165523.0, + "eval_runtime": 85.7958, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.005, + "step": 2640 + }, + { + "entropy": 0.15261746793985367, + "epoch": 6.617683686176837, + "grad_norm": 0.5391237139701843, + "learning_rate": 7.022906815301673e-05, + "loss": 0.0926026999950409, + "mean_token_accuracy": 0.9695659473538398, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.29128045216202736, + "eval_loss": 0.7450292110443115, + "eval_mean_token_accuracy": 0.8498771443616512, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.3963, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 2660 + }, + { + "entropy": 0.16164180357009172, + "epoch": 6.667496886674969, + "grad_norm": 0.5767946243286133, + "learning_rate": 6.841759539535419e-05, + "loss": 0.09291981458663941, + "mean_token_accuracy": 0.9687136687338352, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2897637223088464, + "eval_loss": 0.7503410577774048, + "eval_mean_token_accuracy": 0.8503315164599308, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.0653, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.998, + "step": 2680 + }, + { + "entropy": 0.17062523355707526, + "epoch": 6.717310087173101, + "grad_norm": 0.4974168539047241, + "learning_rate": 6.661961022304563e-05, + "loss": 0.09713236689567566, + "mean_token_accuracy": 0.9661971725523472, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2765843396963075, + "eval_loss": 0.7604002356529236, + "eval_mean_token_accuracy": 0.8521115277395692, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.1676, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 2700 + }, + { + "entropy": 0.17544092936441302, + "epoch": 6.767123287671232, + "grad_norm": 0.5523537993431091, + "learning_rate": 6.483565488389582e-05, + "loss": 0.09709116220474243, + "mean_token_accuracy": 0.9650957375764847, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.27939334659035814, + "eval_loss": 0.7534670829772949, + "eval_mean_token_accuracy": 0.851230604010959, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.2913, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 2720 + }, + { + "entropy": 0.15991022661328316, + "epoch": 6.816936488169365, + "grad_norm": 0.478551983833313, + "learning_rate": 6.306626739450311e-05, + "loss": 0.09564646482467651, + "mean_token_accuracy": 0.9679084822535515, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.27878295491601146, + "eval_loss": 0.7519959211349487, + "eval_mean_token_accuracy": 0.8510654949864676, + "eval_num_tokens": 6397720.0, + "eval_runtime": 85.9109, + "eval_samples_per_second": 16.005, + "eval_steps_per_second": 2.002, + "step": 2740 + }, + { + "entropy": 0.16824879590421915, + "epoch": 6.866749688667497, + "grad_norm": 0.6681098937988281, + "learning_rate": 6.131198137800108e-05, + "loss": 0.0962279736995697, + "mean_token_accuracy": 0.966830012947321, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.2834690434121808, + "eval_loss": 0.751922070980072, + "eval_mean_token_accuracy": 0.8521237577809844, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.3618, + "eval_samples_per_second": 15.921, + "eval_steps_per_second": 1.992, + "step": 2760 + }, + { + "entropy": 0.1518704930320382, + "epoch": 6.916562889165629, + "grad_norm": 0.5201290249824524, + "learning_rate": 5.957332590312513e-05, + "loss": 0.09010660648345947, + "mean_token_accuracy": 0.9693463340401649, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.28485129617674404, + "eval_loss": 0.7452457547187805, + "eval_mean_token_accuracy": 0.8512036796919135, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.4524, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.99, + "step": 2780 + }, + { + "entropy": 0.15512610590085388, + "epoch": 6.966376089663761, + "grad_norm": 0.42802050709724426, + "learning_rate": 5.785082532465233e-05, + "loss": 0.09320432543754578, + "mean_token_accuracy": 0.9686134628951549, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.27554594526110693, + "eval_loss": 0.7644653916358948, + "eval_mean_token_accuracy": 0.8513738523389018, + "eval_num_tokens": 6540175.0, + "eval_runtime": 85.7609, + "eval_samples_per_second": 16.033, + "eval_steps_per_second": 2.006, + "step": 2800 + }, + { + "entropy": 0.17524497526196334, + "epoch": 7.01494396014944, + "grad_norm": 0.3330269157886505, + "learning_rate": 5.6144999125263545e-05, + "loss": 0.0895616888999939, + "mean_token_accuracy": 0.9682766932707566, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.2735865569218647, + "eval_loss": 0.768479585647583, + "eval_mean_token_accuracy": 0.8503459383581959, + "eval_num_tokens": 6583767.0, + "eval_runtime": 85.7162, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.007, + "step": 2820 + }, + { + "entropy": 0.1403565663844347, + "epoch": 7.064757160647572, + "grad_norm": 0.35613498091697693, + "learning_rate": 5.4456361758874235e-05, + "loss": 0.07551313638687134, + "mean_token_accuracy": 0.9739301167428493, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.25941789089593775, + "eval_loss": 0.8209511637687683, + "eval_mean_token_accuracy": 0.8505055855873019, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.0943, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 2840 + }, + { + "entropy": 0.13500106502324344, + "epoch": 7.114570361145703, + "grad_norm": 0.34418627619743347, + "learning_rate": 5.2785422495482234e-05, + "loss": 0.07293946146965027, + "mean_token_accuracy": 0.9747208289802074, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.26482899772912954, + "eval_loss": 0.798904538154602, + "eval_mean_token_accuracy": 0.8511530233677044, + "eval_num_tokens": 6672946.0, + "eval_runtime": 85.7915, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.005, + "step": 2860 + }, + { + "entropy": 0.13127502552233636, + "epoch": 7.164383561643835, + "grad_norm": 0.4638441503047943, + "learning_rate": 5.113268526757892e-05, + "loss": 0.07121461629867554, + "mean_token_accuracy": 0.9756786689162255, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2645381211714689, + "eval_loss": 0.809101939201355, + "eval_mean_token_accuracy": 0.8514727898115335, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.84, + "eval_samples_per_second": 16.018, + "eval_steps_per_second": 2.004, + "step": 2880 + }, + { + "entropy": 0.1331390908919275, + "epoch": 7.214196762141968, + "grad_norm": 0.40206775069236755, + "learning_rate": 4.949864851817007e-05, + "loss": 0.07188264131546021, + "mean_token_accuracy": 0.9755406074225903, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.26244733283339544, + "eval_loss": 0.8143188953399658, + "eval_mean_token_accuracy": 0.8514358189909957, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.8546, + "eval_samples_per_second": 16.015, + "eval_steps_per_second": 2.003, + "step": 2900 + }, + { + "entropy": 0.13647331558167936, + "epoch": 7.2640099626401, + "grad_norm": 0.26405787467956543, + "learning_rate": 4.788380505045224e-05, + "loss": 0.07412450313568116, + "mean_token_accuracy": 0.9744274213910102, + "num_tokens": 6809678.0, + "step": 2920 + }, + { + "epoch": 7.2640099626401, + "eval_entropy": 0.2626111418182074, + "eval_loss": 0.8111525177955627, + "eval_mean_token_accuracy": 0.8512121695418691, + "eval_num_tokens": 6809678.0, + "eval_runtime": 85.9626, + "eval_samples_per_second": 15.995, + "eval_steps_per_second": 2.001, + "step": 2920 + }, + { + "entropy": 0.12644002586603165, + "epoch": 7.313823163138232, + "grad_norm": 0.27514681220054626, + "learning_rate": 4.6288641879189884e-05, + "loss": 0.06807711124420165, + "mean_token_accuracy": 0.9760703906416893, + "num_tokens": 6860750.0, + "step": 2940 + }, + { + "epoch": 7.313823163138232, + "eval_entropy": 0.26096762734097106, + "eval_loss": 0.8184595108032227, + "eval_mean_token_accuracy": 0.8501476153384807, + "eval_num_tokens": 6860750.0, + "eval_runtime": 85.9521, + "eval_samples_per_second": 15.997, + "eval_steps_per_second": 2.001, + "step": 2940 + }, + { + "entropy": 0.13920630998909472, + "epoch": 7.363636363636363, + "grad_norm": 0.23584705591201782, + "learning_rate": 4.4713640083838604e-05, + "loss": 0.07301607131958007, + "mean_token_accuracy": 0.9745715200901032, + "num_tokens": 6907092.0, + "step": 2960 + }, + { + "epoch": 7.363636363636363, + "eval_entropy": 0.2612536767021168, + "eval_loss": 0.8116245269775391, + "eval_mean_token_accuracy": 0.8510967350976412, + "eval_num_tokens": 6907092.0, + "eval_runtime": 85.6373, + "eval_samples_per_second": 16.056, + "eval_steps_per_second": 2.008, + "step": 2960 + }, + { + "entropy": 0.1349492883309722, + "epoch": 7.4134495641344955, + "grad_norm": 0.24552719295024872, + "learning_rate": 4.315927466345791e-05, + "loss": 0.07397544980049134, + "mean_token_accuracy": 0.9745095103979111, + "num_tokens": 6952700.0, + "step": 2980 + }, + { + "epoch": 7.4134495641344955, + "eval_entropy": 0.25796533306670744, + "eval_loss": 0.8266491293907166, + "eval_mean_token_accuracy": 0.8511653857868772, + "eval_num_tokens": 6952700.0, + "eval_runtime": 85.7462, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.006, + "step": 2980 + }, + { + "entropy": 0.14479175000451505, + "epoch": 7.463262764632628, + "grad_norm": 0.2846072018146515, + "learning_rate": 4.162601439345814e-05, + "loss": 0.07544798254966736, + "mean_token_accuracy": 0.9727819666266442, + "num_tokens": 6996430.0, + "step": 3000 + }, + { + "epoch": 7.463262764632628, + "eval_entropy": 0.2584348309698493, + "eval_loss": 0.8253348469734192, + "eval_mean_token_accuracy": 0.8511569815319638, + "eval_num_tokens": 6996430.0, + "eval_runtime": 86.2984, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 3000 + }, + { + "entropy": 0.14114196319133043, + "epoch": 7.51307596513076, + "grad_norm": 0.407966285943985, + "learning_rate": 4.011432168422419e-05, + "loss": 0.0736398994922638, + "mean_token_accuracy": 0.9741654269397259, + "num_tokens": 7042038.0, + "step": 3020 + }, + { + "epoch": 7.51307596513076, + "eval_entropy": 0.25232676260693127, + "eval_loss": 0.8296052813529968, + "eval_mean_token_accuracy": 0.8523298349491385, + "eval_num_tokens": 7042038.0, + "eval_runtime": 85.8445, + "eval_samples_per_second": 16.017, + "eval_steps_per_second": 2.004, + "step": 3020 + }, + { + "entropy": 0.1353456223383546, + "epoch": 7.562889165628892, + "grad_norm": 0.2712634801864624, + "learning_rate": 3.8624652441658684e-05, + "loss": 0.07362412214279175, + "mean_token_accuracy": 0.9747945807874203, + "num_tokens": 7089390.0, + "step": 3040 + }, + { + "epoch": 7.562889165628892, + "eval_entropy": 0.2579477243991785, + "eval_loss": 0.8274564743041992, + "eval_mean_token_accuracy": 0.8517705212498821, + "eval_num_tokens": 7089390.0, + "eval_runtime": 85.8222, + "eval_samples_per_second": 16.022, + "eval_steps_per_second": 2.004, + "step": 3040 + }, + { + "entropy": 0.1296080862637609, + "epoch": 7.6127023661270234, + "grad_norm": 0.2371893972158432, + "learning_rate": 3.715745592968707e-05, + "loss": 0.06971035599708557, + "mean_token_accuracy": 0.9759043246507645, + "num_tokens": 7138002.0, + "step": 3060 + }, + { + "epoch": 7.6127023661270234, + "eval_entropy": 0.25391967083479083, + "eval_loss": 0.8197130560874939, + "eval_mean_token_accuracy": 0.8522267875283264, + "eval_num_tokens": 7138002.0, + "eval_runtime": 85.8796, + "eval_samples_per_second": 16.011, + "eval_steps_per_second": 2.003, + "step": 3060 + }, + { + "entropy": 0.1311203008517623, + "epoch": 7.662515566625156, + "grad_norm": 0.22499267756938934, + "learning_rate": 3.5713174634765967e-05, + "loss": 0.07176244258880615, + "mean_token_accuracy": 0.9754939571022987, + "num_tokens": 7185520.0, + "step": 3080 + }, + { + "epoch": 7.662515566625156, + "eval_entropy": 0.2526215241225653, + "eval_loss": 0.8265154361724854, + "eval_mean_token_accuracy": 0.8519952584837758, + "eval_num_tokens": 7185520.0, + "eval_runtime": 85.8746, + "eval_samples_per_second": 16.012, + "eval_steps_per_second": 2.003, + "step": 3080 + }, + { + "entropy": 0.13420484317466616, + "epoch": 7.712328767123288, + "grad_norm": 0.2398064285516739, + "learning_rate": 3.4292244132434866e-05, + "loss": 0.07559212446212768, + "mean_token_accuracy": 0.9743142127990723, + "num_tokens": 7232170.0, + "step": 3100 + }, + { + "epoch": 7.712328767123288, + "eval_entropy": 0.2484562756537005, + "eval_loss": 0.8312150239944458, + "eval_mean_token_accuracy": 0.8528405119513356, + "eval_num_tokens": 7232170.0, + "eval_runtime": 85.7896, + "eval_samples_per_second": 16.028, + "eval_steps_per_second": 2.005, + "step": 3100 + }, + { + "entropy": 0.11965563679113984, + "epoch": 7.76214196762142, + "grad_norm": 0.3408384919166565, + "learning_rate": 3.2895092955952746e-05, + "loss": 0.0661750853061676, + "mean_token_accuracy": 0.9776600524783134, + "num_tokens": 7282846.0, + "step": 3120 + }, + { + "epoch": 7.76214196762142, + "eval_entropy": 0.2522421533804993, + "eval_loss": 0.8327009677886963, + "eval_mean_token_accuracy": 0.8524222023958383, + "eval_num_tokens": 7282846.0, + "eval_runtime": 86.1769, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 1.996, + "step": 3120 + }, + { + "entropy": 0.13388084415346385, + "epoch": 7.811955168119551, + "grad_norm": 0.35418516397476196, + "learning_rate": 3.152214246705829e-05, + "loss": 0.07149899601936341, + "mean_token_accuracy": 0.9747635535895824, + "num_tokens": 7331518.0, + "step": 3140 + }, + { + "epoch": 7.811955168119551, + "eval_entropy": 0.25038352296795957, + "eval_loss": 0.836457371711731, + "eval_mean_token_accuracy": 0.8526130665180295, + "eval_num_tokens": 7331518.0, + "eval_runtime": 85.6099, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.009, + "step": 3140 + }, + { + "entropy": 0.13530643959529698, + "epoch": 7.861768368617684, + "grad_norm": 0.38060539960861206, + "learning_rate": 3.017380672889291e-05, + "loss": 0.07116585969924927, + "mean_token_accuracy": 0.973284512758255, + "num_tokens": 7379056.0, + "step": 3160 + }, + { + "epoch": 7.861768368617684, + "eval_entropy": 0.255092611319797, + "eval_loss": 0.8314701914787292, + "eval_mean_token_accuracy": 0.8520913099826768, + "eval_num_tokens": 7379056.0, + "eval_runtime": 85.877, + "eval_samples_per_second": 16.011, + "eval_steps_per_second": 2.003, + "step": 3160 + }, + { + "entropy": 0.13383390177041293, + "epoch": 7.911581569115816, + "grad_norm": 0.3827536106109619, + "learning_rate": 2.8850492381124808e-05, + "loss": 0.07305437326431274, + "mean_token_accuracy": 0.9750778004527092, + "num_tokens": 7424770.0, + "step": 3180 + }, + { + "epoch": 7.911581569115816, + "eval_entropy": 0.25416371157003004, + "eval_loss": 0.8206402063369751, + "eval_mean_token_accuracy": 0.852779901651449, + "eval_num_tokens": 7424770.0, + "eval_runtime": 86.1015, + "eval_samples_per_second": 15.97, + "eval_steps_per_second": 1.998, + "step": 3180 + }, + { + "entropy": 0.1395680439658463, + "epoch": 7.961394769613948, + "grad_norm": 0.3809775412082672, + "learning_rate": 2.7552598517312256e-05, + "loss": 0.07236042022705078, + "mean_token_accuracy": 0.9731538116931915, + "num_tokens": 7470804.0, + "step": 3200 + }, + { + "epoch": 7.961394769613948, + "eval_entropy": 0.25528111975899964, + "eval_loss": 0.8230037093162537, + "eval_mean_token_accuracy": 0.8526452603035195, + "eval_num_tokens": 7470804.0, + "eval_runtime": 85.7895, + "eval_samples_per_second": 16.028, + "eval_steps_per_second": 2.005, + "step": 3200 + }, + { + "entropy": 0.12193699864049752, + "epoch": 8.009962640099626, + "grad_norm": 0.11854425817728043, + "learning_rate": 2.6280516564542205e-05, + "loss": 0.06617764234542847, + "mean_token_accuracy": 0.977179691577569, + "num_tokens": 7518110.0, + "step": 3220 + }, + { + "epoch": 8.009962640099626, + "eval_entropy": 0.25100527677771656, + "eval_loss": 0.8393343687057495, + "eval_mean_token_accuracy": 0.8522553132023922, + "eval_num_tokens": 7518110.0, + "eval_runtime": 85.8837, + "eval_samples_per_second": 16.01, + "eval_steps_per_second": 2.003, + "step": 3220 + }, + { + "entropy": 0.12788885813206435, + "epoch": 8.059775840597759, + "grad_norm": 0.16094881296157837, + "learning_rate": 2.50346301653812e-05, + "loss": 0.06274186968803405, + "mean_token_accuracy": 0.9766994707286358, + "num_tokens": 7565539.0, + "step": 3240 + }, + { + "epoch": 8.059775840597759, + "eval_entropy": 0.24409458682287571, + "eval_loss": 0.874617338180542, + "eval_mean_token_accuracy": 0.8521041180505309, + "eval_num_tokens": 7565539.0, + "eval_runtime": 86.2656, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 3240 + }, + { + "entropy": 0.12464155335910618, + "epoch": 8.10958904109589, + "grad_norm": 0.16893954575061798, + "learning_rate": 2.381531506217437e-05, + "loss": 0.06093020439147949, + "mean_token_accuracy": 0.9776258453726768, + "num_tokens": 7612578.0, + "step": 3260 + }, + { + "epoch": 8.10958904109589, + "eval_entropy": 0.24396493017326953, + "eval_loss": 0.891161322593689, + "eval_mean_token_accuracy": 0.8515338024427724, + "eval_num_tokens": 7612578.0, + "eval_runtime": 85.9061, + "eval_samples_per_second": 16.006, + "eval_steps_per_second": 2.002, + "step": 3260 + }, + { + "entropy": 0.12345920228399336, + "epoch": 8.159402241594023, + "grad_norm": 0.14332273602485657, + "learning_rate": 2.262293898372616e-05, + "loss": 0.061289966106414795, + "mean_token_accuracy": 0.9762230902910233, + "num_tokens": 7660157.0, + "step": 3280 + }, + { + "epoch": 8.159402241594023, + "eval_entropy": 0.2481445314059424, + "eval_loss": 0.8922848105430603, + "eval_mean_token_accuracy": 0.8514944855556932, + "eval_num_tokens": 7660157.0, + "eval_runtime": 85.5201, + "eval_samples_per_second": 16.078, + "eval_steps_per_second": 2.011, + "step": 3280 + }, + { + "entropy": 0.12298110066913068, + "epoch": 8.209215442092155, + "grad_norm": 0.21848882734775543, + "learning_rate": 2.1457861534398633e-05, + "loss": 0.05986443758010864, + "mean_token_accuracy": 0.9786281704902648, + "num_tokens": 7709745.0, + "step": 3300 + }, + { + "epoch": 8.209215442092155, + "eval_entropy": 0.24329388124305149, + "eval_loss": 0.9021085500717163, + "eval_mean_token_accuracy": 0.8521762625422589, + "eval_num_tokens": 7709745.0, + "eval_runtime": 85.955, + "eval_samples_per_second": 15.997, + "eval_steps_per_second": 2.001, + "step": 3300 + }, + { + "entropy": 0.13265180448070168, + "epoch": 8.259028642590286, + "grad_norm": 0.18067947030067444, + "learning_rate": 2.0320434085659692e-05, + "loss": 0.06724961400032044, + "mean_token_accuracy": 0.975098168104887, + "num_tokens": 7753571.0, + "step": 3320 + }, + { + "epoch": 8.259028642590286, + "eval_entropy": 0.2433211464694766, + "eval_loss": 0.9094350337982178, + "eval_mean_token_accuracy": 0.8520150094531304, + "eval_num_tokens": 7753571.0, + "eval_runtime": 85.7989, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.005, + "step": 3320 + }, + { + "entropy": 0.11949320202693343, + "epoch": 8.308841843088418, + "grad_norm": 0.17020289599895477, + "learning_rate": 1.9210999670114196e-05, + "loss": 0.0634455680847168, + "mean_token_accuracy": 0.9771294385194779, + "num_tokens": 7799310.0, + "step": 3340 + }, + { + "epoch": 8.308841843088418, + "eval_entropy": 0.24345201219237128, + "eval_loss": 0.9021793603897095, + "eval_mean_token_accuracy": 0.8520745697409607, + "eval_num_tokens": 7799310.0, + "eval_runtime": 86.0883, + "eval_samples_per_second": 15.972, + "eval_steps_per_second": 1.998, + "step": 3340 + }, + { + "entropy": 0.12065747743472457, + "epoch": 8.35865504358655, + "grad_norm": 0.16789060831069946, + "learning_rate": 1.8129892878049886e-05, + "loss": 0.061494195461273195, + "mean_token_accuracy": 0.9779584899544715, + "num_tokens": 7846447.0, + "step": 3360 + }, + { + "epoch": 8.35865504358655, + "eval_entropy": 0.24093415042342142, + "eval_loss": 0.9006755352020264, + "eval_mean_token_accuracy": 0.852174230786257, + "eval_num_tokens": 7846447.0, + "eval_runtime": 85.9011, + "eval_samples_per_second": 16.007, + "eval_steps_per_second": 2.002, + "step": 3360 + }, + { + "entropy": 0.13125578537583352, + "epoch": 8.408468244084682, + "grad_norm": 0.1662452220916748, + "learning_rate": 1.70774397565298e-05, + "loss": 0.06685600876808166, + "mean_token_accuracy": 0.9744067586958408, + "num_tokens": 7890283.0, + "step": 3380 + }, + { + "epoch": 8.408468244084682, + "eval_entropy": 0.24062153688350388, + "eval_loss": 0.9078915119171143, + "eval_mean_token_accuracy": 0.8523201647886011, + "eval_num_tokens": 7890283.0, + "eval_runtime": 86.0201, + "eval_samples_per_second": 15.985, + "eval_steps_per_second": 2.0, + "step": 3380 + }, + { + "entropy": 0.11986117120832204, + "epoch": 8.458281444582815, + "grad_norm": 0.19571948051452637, + "learning_rate": 1.6053957711060606e-05, + "loss": 0.06411095261573792, + "mean_token_accuracy": 0.9770627245306969, + "num_tokens": 7936518.0, + "step": 3400 + }, + { + "epoch": 8.458281444582815, + "eval_entropy": 0.24352820347561394, + "eval_loss": 0.9058943390846252, + "eval_mean_token_accuracy": 0.8519382792156797, + "eval_num_tokens": 7936518.0, + "eval_runtime": 85.966, + "eval_samples_per_second": 15.995, + "eval_steps_per_second": 2.001, + "step": 3400 + }, + { + "entropy": 0.12857897616922856, + "epoch": 8.508094645080947, + "grad_norm": 0.2609264850616455, + "learning_rate": 1.5059755409867613e-05, + "loss": 0.06473397612571716, + "mean_token_accuracy": 0.9764650195837021, + "num_tokens": 7981966.0, + "step": 3420 + }, + { + "epoch": 8.508094645080947, + "eval_entropy": 0.24032609000108962, + "eval_loss": 0.9077776074409485, + "eval_mean_token_accuracy": 0.8517829197090726, + "eval_num_tokens": 7981966.0, + "eval_runtime": 86.6059, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 3420 + }, + { + "entropy": 0.12348870886489749, + "epoch": 8.557907845579079, + "grad_norm": 0.19537609815597534, + "learning_rate": 1.409513269080473e-05, + "loss": 0.06481348872184753, + "mean_token_accuracy": 0.9769559659063816, + "num_tokens": 8028367.0, + "step": 3440 + }, + { + "epoch": 8.557907845579079, + "eval_entropy": 0.2404322574824788, + "eval_loss": 0.9057720899581909, + "eval_mean_token_accuracy": 0.8521037981953732, + "eval_num_tokens": 8028367.0, + "eval_runtime": 86.166, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.996, + "step": 3440 + }, + { + "entropy": 0.12040232736617326, + "epoch": 8.607721046077211, + "grad_norm": 0.3310582935810089, + "learning_rate": 1.3160380470927183e-05, + "loss": 0.06468871235847473, + "mean_token_accuracy": 0.9768650442361831, + "num_tokens": 8074934.0, + "step": 3460 + }, + { + "epoch": 8.607721046077211, + "eval_entropy": 0.24118655876711356, + "eval_loss": 0.9028318524360657, + "eval_mean_token_accuracy": 0.8521025340224422, + "eval_num_tokens": 8074934.0, + "eval_runtime": 85.3668, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.015, + "step": 3460 + }, + { + "entropy": 0.12328103906475008, + "epoch": 8.657534246575342, + "grad_norm": 0.12836167216300964, + "learning_rate": 1.2255780658755122e-05, + "loss": 0.06229386329650879, + "mean_token_accuracy": 0.9763277888298034, + "num_tokens": 8122775.0, + "step": 3480 + }, + { + "epoch": 8.657534246575342, + "eval_entropy": 0.24194598145956217, + "eval_loss": 0.9009329080581665, + "eval_mean_token_accuracy": 0.8521693289973015, + "eval_num_tokens": 8122775.0, + "eval_runtime": 85.9415, + "eval_samples_per_second": 15.999, + "eval_steps_per_second": 2.001, + "step": 3480 + }, + { + "entropy": 0.11321646976284683, + "epoch": 8.707347447073474, + "grad_norm": 0.15656894445419312, + "learning_rate": 1.1381606069253786e-05, + "loss": 0.05908188819885254, + "mean_token_accuracy": 0.9779504477977753, + "num_tokens": 8174307.0, + "step": 3500 + }, + { + "epoch": 8.707347447073474, + "eval_entropy": 0.24121542517528977, + "eval_loss": 0.9016091823577881, + "eval_mean_token_accuracy": 0.8521790667328724, + "eval_num_tokens": 8174307.0, + "eval_runtime": 85.7465, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.006, + "step": 3500 + }, + { + "entropy": 0.12657046681270004, + "epoch": 8.757160647571606, + "grad_norm": 0.22597502171993256, + "learning_rate": 1.053812034155629e-05, + "loss": 0.06244581937789917, + "mean_token_accuracy": 0.976795207709074, + "num_tokens": 8222808.0, + "step": 3520 + }, + { + "epoch": 8.757160647571606, + "eval_entropy": 0.23877542708502258, + "eval_loss": 0.9069110155105591, + "eval_mean_token_accuracy": 0.8522880177858264, + "eval_num_tokens": 8222808.0, + "eval_runtime": 85.7792, + "eval_samples_per_second": 16.03, + "eval_steps_per_second": 2.005, + "step": 3520 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.471473589255168e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3540/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3540/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3540/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3540/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3540/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3540/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3540/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3540/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3540/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3540/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3540/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3540/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3540/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3540/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..bbacf3484769c514d268b015c46536a15fad5ec0 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3540/trainer_state.json @@ -0,0 +1,3751 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 8.806973848069738, + "eval_steps": 20, + "global_step": 3540, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + }, + { + "entropy": 0.561330484598875, + "epoch": 1.891656288916563, + "grad_norm": 0.6722865700721741, + "learning_rate": 0.0002208867897174789, + "loss": 0.499837589263916, + "mean_token_accuracy": 0.8518734864890576, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.5865232653396074, + "eval_loss": 0.5437926650047302, + "eval_mean_token_accuracy": 0.8450997017843779, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4116, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.547389242425561, + "epoch": 1.9414694894146949, + "grad_norm": 0.7935577034950256, + "learning_rate": 0.00022027119820226907, + "loss": 0.4977591514587402, + "mean_token_accuracy": 0.8539491161704064, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.5290903090391048, + "eval_loss": 0.5409526824951172, + "eval_mean_token_accuracy": 0.8497545698354411, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.7262, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 780 + }, + { + "entropy": 0.5687909748405218, + "epoch": 1.9912826899128269, + "grad_norm": 0.6180546283721924, + "learning_rate": 0.00021962329729698345, + "loss": 0.5109643459320068, + "mean_token_accuracy": 0.8521598495543004, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.5503541858390321, + "eval_loss": 0.5361555218696594, + "eval_mean_token_accuracy": 0.8510884285666221, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.3339, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 800 + }, + { + "entropy": 0.4739728841261986, + "epoch": 2.0398505603985058, + "grad_norm": 0.8058829307556152, + "learning_rate": 0.0002189432823996982, + "loss": 0.4204097747802734, + "mean_token_accuracy": 0.8728981889211215, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.5077334992414297, + "eval_loss": 0.5531114339828491, + "eval_mean_token_accuracy": 0.8489257208136625, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.4801, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.989, + "step": 820 + }, + { + "entropy": 0.4594309840351343, + "epoch": 2.0896637608966375, + "grad_norm": 0.6906896829605103, + "learning_rate": 0.0002182313585936314, + "loss": 0.4071959495544434, + "mean_token_accuracy": 0.8732857562601566, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.49850136994622474, + "eval_loss": 0.5486204624176025, + "eval_mean_token_accuracy": 0.8507991450470548, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.3364, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.4881629109382629, + "epoch": 2.1394769613947697, + "grad_norm": 0.6343470215797424, + "learning_rate": 0.0002174877405852928, + "loss": 0.41669540405273436, + "mean_token_accuracy": 0.8711295068264008, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.49155513924914734, + "eval_loss": 0.555109441280365, + "eval_mean_token_accuracy": 0.8496399400539176, + "eval_num_tokens": 2008562.0, + "eval_runtime": 86.3295, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 860 + }, + { + "entropy": 0.4648668970912695, + "epoch": 2.1892901618929015, + "grad_norm": 0.8014165163040161, + "learning_rate": 0.00021671265263973133, + "loss": 0.4110250473022461, + "mean_token_accuracy": 0.8754166305065155, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.4909258722219356, + "eval_loss": 0.5539511442184448, + "eval_mean_token_accuracy": 0.8492401502160138, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.3468, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 880 + }, + { + "entropy": 0.4824485514312983, + "epoch": 2.2391033623910337, + "grad_norm": 0.6665191054344177, + "learning_rate": 0.00021590632851289967, + "loss": 0.4181404113769531, + "mean_token_accuracy": 0.8726993151009083, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.4986876940657926, + "eval_loss": 0.547695517539978, + "eval_mean_token_accuracy": 0.8501384708770486, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.3838, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 900 + }, + { + "entropy": 0.4751896943897009, + "epoch": 2.2889165628891655, + "grad_norm": 0.81158047914505, + "learning_rate": 0.00021506901138115678, + "loss": 0.40689678192138673, + "mean_token_accuracy": 0.8745221219956875, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.507153491121392, + "eval_loss": 0.5501641631126404, + "eval_mean_token_accuracy": 0.8495670116918032, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.0912, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 920 + }, + { + "entropy": 0.4873133715242147, + "epoch": 2.3387297633872977, + "grad_norm": 0.7218056321144104, + "learning_rate": 0.0002142009537679292, + "loss": 0.42701358795166017, + "mean_token_accuracy": 0.8695114746689796, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5202612736543943, + "eval_loss": 0.5491839051246643, + "eval_mean_token_accuracy": 0.8494071208460386, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.1142, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 940 + }, + { + "entropy": 0.4762951169162989, + "epoch": 2.3885429638854294, + "grad_norm": 0.7194424867630005, + "learning_rate": 0.0002133024174675534, + "loss": 0.42299847602844237, + "mean_token_accuracy": 0.8709790132939815, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4899340462546016, + "eval_loss": 0.5522511601448059, + "eval_mean_token_accuracy": 0.8492208258357159, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.463, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 960 + }, + { + "entropy": 0.49650347977876663, + "epoch": 2.4383561643835616, + "grad_norm": 0.8406022787094116, + "learning_rate": 0.0002123736734663221, + "loss": 0.4275330066680908, + "mean_token_accuracy": 0.8670595556497573, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.49691385654515996, + "eval_loss": 0.5491269826889038, + "eval_mean_token_accuracy": 0.850309816210769, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.17, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 980 + }, + { + "entropy": 0.48843890577554705, + "epoch": 2.488169364881694, + "grad_norm": 0.9082473516464233, + "learning_rate": 0.00021141500186075868, + "loss": 0.4309722423553467, + "mean_token_accuracy": 0.8686766296625137, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5543508351195691, + "eval_loss": 0.5478800535202026, + "eval_mean_token_accuracy": 0.8478029522784921, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.3835, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 1000 + }, + { + "entropy": 0.4777219031006098, + "epoch": 2.5379825653798256, + "grad_norm": 0.7448089122772217, + "learning_rate": 0.0002104266917731438, + "loss": 0.423325252532959, + "mean_token_accuracy": 0.8706337086856365, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.49857561550168106, + "eval_loss": 0.5511948466300964, + "eval_mean_token_accuracy": 0.8502220289651737, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.5399, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.988, + "step": 1020 + }, + { + "entropy": 0.4844174191355705, + "epoch": 2.587795765877958, + "grad_norm": 0.794029176235199, + "learning_rate": 0.00020940904126432, + "loss": 0.4176753044128418, + "mean_token_accuracy": 0.873535567522049, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.485467542222766, + "eval_loss": 0.5539286732673645, + "eval_mean_token_accuracy": 0.8495475081510322, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.135, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 1.997, + "step": 1040 + }, + { + "entropy": 0.49070929251611234, + "epoch": 2.6376089663760895, + "grad_norm": 0.7558256983757019, + "learning_rate": 0.0002083623572438007, + "loss": 0.42867293357849123, + "mean_token_accuracy": 0.8696666076779366, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.490822730889154, + "eval_loss": 0.5434785485267639, + "eval_mean_token_accuracy": 0.850568296950917, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.4933, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 1060 + }, + { + "entropy": 0.47806114703416824, + "epoch": 2.6874221668742218, + "grad_norm": 0.6608979105949402, + "learning_rate": 0.00020728695537721047, + "loss": 0.4289727687835693, + "mean_token_accuracy": 0.8693130135536193, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.5285773256490397, + "eval_loss": 0.5444230437278748, + "eval_mean_token_accuracy": 0.8498796481032704, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.7091, + "eval_samples_per_second": 15.858, + "eval_steps_per_second": 1.984, + "step": 1080 + }, + { + "entropy": 0.5046216730028391, + "epoch": 2.7372353673723535, + "grad_norm": 0.8428544998168945, + "learning_rate": 0.00020618315999108454, + "loss": 0.43131070137023925, + "mean_token_accuracy": 0.8701941035687923, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.49888394738352576, + "eval_loss": 0.5459766387939453, + "eval_mean_token_accuracy": 0.8511758872935938, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.2222, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.995, + "step": 1100 + }, + { + "entropy": 0.5212558470666409, + "epoch": 2.7870485678704857, + "grad_norm": 1.129318118095398, + "learning_rate": 0.00020505130397505635, + "loss": 0.44249300956726073, + "mean_token_accuracy": 0.8654101334512234, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5179622324053631, + "eval_loss": 0.5522801280021667, + "eval_mean_token_accuracy": 0.8497019947268242, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.1903, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.996, + "step": 1120 + }, + { + "entropy": 0.4988406613469124, + "epoch": 2.8368617683686175, + "grad_norm": 0.6460545063018799, + "learning_rate": 0.00020389172868146263, + "loss": 0.4386270523071289, + "mean_token_accuracy": 0.8690383620560169, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.5042278484203094, + "eval_loss": 0.5433034300804138, + "eval_mean_token_accuracy": 0.8497674451317898, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.3028, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.993, + "step": 1140 + }, + { + "entropy": 0.4926559619605541, + "epoch": 2.8866749688667497, + "grad_norm": 0.8199329972267151, + "learning_rate": 0.00020270478382239615, + "loss": 0.4313485145568848, + "mean_token_accuracy": 0.8674727231264114, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.503873193160046, + "eval_loss": 0.5388111472129822, + "eval_mean_token_accuracy": 0.8526195034731266, + "eval_num_tokens": 2710196.0, + "eval_runtime": 86.4054, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.991, + "step": 1160 + }, + { + "entropy": 0.5020013231784105, + "epoch": 2.936488169364882, + "grad_norm": 0.7344821095466614, + "learning_rate": 0.00020149082736423723, + "loss": 0.43590536117553713, + "mean_token_accuracy": 0.8671772189438343, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5368241809828337, + "eval_loss": 0.5355703830718994, + "eval_mean_token_accuracy": 0.8517617773871089, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.2945, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1180 + }, + { + "entropy": 0.5112275708466768, + "epoch": 2.9863013698630136, + "grad_norm": 0.6951606869697571, + "learning_rate": 0.00020025022541969622, + "loss": 0.43579301834106443, + "mean_token_accuracy": 0.8641206480562686, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.5066795706055885, + "eval_loss": 0.5415249466896057, + "eval_mean_token_accuracy": 0.8493563373421513, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.5005, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.988, + "step": 1200 + }, + { + "entropy": 0.42298635305502474, + "epoch": 3.0348692403486925, + "grad_norm": 0.8201794028282166, + "learning_rate": 0.00019898335213739863, + "loss": 0.35593905448913576, + "mean_token_accuracy": 0.889238600547497, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.4584170470750609, + "eval_loss": 0.569487452507019, + "eval_mean_token_accuracy": 0.8495814173027526, + "eval_num_tokens": 2848509.0, + "eval_runtime": 86.2281, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 1220 + }, + { + "entropy": 0.37450140453875064, + "epoch": 3.0846824408468243, + "grad_norm": 0.7308394908905029, + "learning_rate": 0.0001976905895890471, + "loss": 0.307823920249939, + "mean_token_accuracy": 0.9001288741827012, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.45185995916294497, + "eval_loss": 0.5672881603240967, + "eval_mean_token_accuracy": 0.8511318519364955, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.0819, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.998, + "step": 1240 + }, + { + "entropy": 0.3887945845723152, + "epoch": 3.1344956413449565, + "grad_norm": 0.7299330830574036, + "learning_rate": 0.0001963723276541939, + "loss": 0.32047903537750244, + "mean_token_accuracy": 0.8960984498262405, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.44865354549053105, + "eval_loss": 0.5666037201881409, + "eval_mean_token_accuracy": 0.8496572649063066, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 1260 + }, + { + "entropy": 0.39677664265036583, + "epoch": 3.1843088418430883, + "grad_norm": 0.9533219933509827, + "learning_rate": 0.00019502896390265838, + "loss": 0.3253983497619629, + "mean_token_accuracy": 0.8964207418262958, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.4641980809527774, + "eval_loss": 0.5814996957778931, + "eval_mean_token_accuracy": 0.8485886212005171, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.7784, + "eval_samples_per_second": 15.845, + "eval_steps_per_second": 1.982, + "step": 1280 + }, + { + "entropy": 0.39210722744464876, + "epoch": 3.2341220423412205, + "grad_norm": 0.7447651028633118, + "learning_rate": 0.00019366090347462545, + "loss": 0.3276803970336914, + "mean_token_accuracy": 0.8930055953562259, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43595615254585135, + "eval_loss": 0.5722188353538513, + "eval_mean_token_accuracy": 0.8501105755567551, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.5271, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 1300 + }, + { + "entropy": 0.3684127271175385, + "epoch": 3.2839352428393527, + "grad_norm": 0.6934201121330261, + "learning_rate": 0.00019226855895846078, + "loss": 0.3156379222869873, + "mean_token_accuracy": 0.8976306475698947, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.4628148723480313, + "eval_loss": 0.5631352066993713, + "eval_mean_token_accuracy": 0.8504934813394103, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.3436, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 1320 + }, + { + "entropy": 0.4073401909321547, + "epoch": 3.3337484433374844, + "grad_norm": 0.9386897683143616, + "learning_rate": 0.00019085235026627994, + "loss": 0.34265310764312745, + "mean_token_accuracy": 0.8902062118053437, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.46455050623694133, + "eval_loss": 0.5586736798286438, + "eval_mean_token_accuracy": 0.8506874702004499, + "eval_num_tokens": 3132874.0, + "eval_runtime": 86.1286, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.997, + "step": 1340 + }, + { + "entropy": 0.4046429242938757, + "epoch": 3.383561643835616, + "grad_norm": 0.9633992314338684, + "learning_rate": 0.00018941270450730836, + "loss": 0.33816893100738527, + "mean_token_accuracy": 0.8927541889250279, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.46846531660750856, + "eval_loss": 0.561501681804657, + "eval_mean_token_accuracy": 0.8496256377114806, + "eval_num_tokens": 3178055.0, + "eval_runtime": 86.685, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1360 + }, + { + "entropy": 0.39872407019138334, + "epoch": 3.4333748443337484, + "grad_norm": 0.7786458730697632, + "learning_rate": 0.00018795005585907113, + "loss": 0.33342490196228025, + "mean_token_accuracy": 0.8944805048406124, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.42709505973860273, + "eval_loss": 0.5751848220825195, + "eval_mean_token_accuracy": 0.8507290447867194, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.6892, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 1380 + }, + { + "entropy": 0.3923338124528527, + "epoch": 3.4831880448318806, + "grad_norm": 0.9305956363677979, + "learning_rate": 0.0001864648454364511, + "loss": 0.33188116550445557, + "mean_token_accuracy": 0.8943330392241478, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.4386174779298694, + "eval_loss": 0.5680831074714661, + "eval_mean_token_accuracy": 0.8513129727784977, + "eval_num_tokens": 3274096.0, + "eval_runtime": 86.2671, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 1400 + }, + { + "entropy": 0.3856233984231949, + "epoch": 3.5330012453300124, + "grad_norm": 1.0362752676010132, + "learning_rate": 0.0001849575211586545, + "loss": 0.33098697662353516, + "mean_token_accuracy": 0.8961390435695649, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4574795474493226, + "eval_loss": 0.5630439519882202, + "eval_mean_token_accuracy": 0.8520988873964133, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.6035, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 1420 + }, + { + "entropy": 0.39812871962785723, + "epoch": 3.5828144458281446, + "grad_norm": 0.7807195782661438, + "learning_rate": 0.0001834285376141247, + "loss": 0.3333771228790283, + "mean_token_accuracy": 0.8930827379226685, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.4556825893909432, + "eval_loss": 0.5689062476158142, + "eval_mean_token_accuracy": 0.8507103507601937, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.1606, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.996, + "step": 1440 + }, + { + "entropy": 0.4147744856774807, + "epoch": 3.6326276463262763, + "grad_norm": 0.6429352164268494, + "learning_rate": 0.00018187835592344443, + "loss": 0.3482560873031616, + "mean_token_accuracy": 0.8910200245678425, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.46600024540757023, + "eval_loss": 0.5609709024429321, + "eval_mean_token_accuracy": 0.8491220876227977, + "eval_num_tokens": 3415600.0, + "eval_runtime": 86.8039, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1460 + }, + { + "entropy": 0.40425071083009245, + "epoch": 3.6824408468244085, + "grad_norm": 0.8613698482513428, + "learning_rate": 0.0001803074436002682, + "loss": 0.342916464805603, + "mean_token_accuracy": 0.8916418336331844, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.43855057899342026, + "eval_loss": 0.5720968246459961, + "eval_mean_token_accuracy": 0.8500823641932288, + "eval_num_tokens": 3460471.0, + "eval_runtime": 86.6746, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1480 + }, + { + "entropy": 0.39465143866837027, + "epoch": 3.7322540473225407, + "grad_norm": 0.6285189986228943, + "learning_rate": 0.0001787162744103265, + "loss": 0.3424591779708862, + "mean_token_accuracy": 0.8906558901071548, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4509461877304454, + "eval_loss": 0.5590082406997681, + "eval_mean_token_accuracy": 0.8511747371318729, + "eval_num_tokens": 3507647.0, + "eval_runtime": 86.8126, + "eval_samples_per_second": 15.839, + "eval_steps_per_second": 1.981, + "step": 1500 + }, + { + "entropy": 0.4021005939692259, + "epoch": 3.7820672478206725, + "grad_norm": 0.8821248412132263, + "learning_rate": 0.00017710532822854468, + "loss": 0.3462103843688965, + "mean_token_accuracy": 0.889109355956316, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.4502199075596277, + "eval_loss": 0.566046416759491, + "eval_mean_token_accuracy": 0.8501714208098345, + "eval_num_tokens": 3548934.0, + "eval_runtime": 86.8336, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.981, + "step": 1520 + }, + { + "entropy": 0.4017397932708263, + "epoch": 3.8318804483188043, + "grad_norm": 0.8400952816009521, + "learning_rate": 0.0001754750908943189, + "loss": 0.34890995025634763, + "mean_token_accuracy": 0.8892098367214203, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.4614003023435903, + "eval_loss": 0.5617933869361877, + "eval_mean_token_accuracy": 0.8515863616106122, + "eval_num_tokens": 3597186.0, + "eval_runtime": 86.4609, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 1540 + }, + { + "entropy": 0.4112051840871572, + "epoch": 3.8816936488169365, + "grad_norm": 0.769478440284729, + "learning_rate": 0.0001738260540649939, + "loss": 0.34711437225341796, + "mean_token_accuracy": 0.8911717928946018, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4540443811998811, + "eval_loss": 0.5576469898223877, + "eval_mean_token_accuracy": 0.8512079674144124, + "eval_num_tokens": 3646646.0, + "eval_runtime": 86.5103, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 1560 + }, + { + "entropy": 0.41105241514742374, + "epoch": 3.9315068493150687, + "grad_norm": 0.8468427062034607, + "learning_rate": 0.00017215871506758568, + "loss": 0.3433023452758789, + "mean_token_accuracy": 0.8898739732801915, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.4707539707075718, + "eval_loss": 0.5641466379165649, + "eval_mean_token_accuracy": 0.8495440957851188, + "eval_num_tokens": 3689560.0, + "eval_runtime": 86.609, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.986, + "step": 1580 + }, + { + "entropy": 0.41016379147768023, + "epoch": 3.9813200498132004, + "grad_norm": 0.7482675313949585, + "learning_rate": 0.0001704735767487946, + "loss": 0.34550890922546384, + "mean_token_accuracy": 0.8893028847873211, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.46391099864660307, + "eval_loss": 0.5593640804290771, + "eval_mean_token_accuracy": 0.8510130581467651, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.3975, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 1600 + }, + { + "entropy": 0.33167599791135544, + "epoch": 4.029887920298879, + "grad_norm": 0.9435692429542542, + "learning_rate": 0.00016877114732335337, + "loss": 0.2716026544570923, + "mean_token_accuracy": 0.9133149828666296, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.38499350005457567, + "eval_loss": 0.6298249363899231, + "eval_mean_token_accuracy": 0.8488117071778275, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.2933, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1620 + }, + { + "entropy": 0.3000166634097695, + "epoch": 4.0797011207970115, + "grad_norm": 0.8080845475196838, + "learning_rate": 0.0001670519402207569, + "loss": 0.22617182731628419, + "mean_token_accuracy": 0.9253474645316601, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.370110988703578, + "eval_loss": 0.6338461637496948, + "eval_mean_token_accuracy": 0.8485634801692741, + "eval_num_tokens": 3828830.0, + "eval_runtime": 85.9508, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.001, + "step": 1640 + }, + { + "entropy": 0.2986910421401262, + "epoch": 4.129514321295143, + "grad_norm": 0.7310900092124939, + "learning_rate": 0.0001653164739304185, + "loss": 0.22367463111877442, + "mean_token_accuracy": 0.9252275295555592, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.3944379702037157, + "eval_loss": 0.6109381914138794, + "eval_mean_token_accuracy": 0.849291454220927, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.6728, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1660 + }, + { + "entropy": 0.3095553796738386, + "epoch": 4.179327521793275, + "grad_norm": 0.7059140801429749, + "learning_rate": 0.0001635652718453007, + "loss": 0.23651680946350098, + "mean_token_accuracy": 0.9208931416273117, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.3910588648949945, + "eval_loss": 0.6104469299316406, + "eval_mean_token_accuracy": 0.8486883893262508, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7612, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.982, + "step": 1680 + }, + { + "entropy": 0.3001101028174162, + "epoch": 4.229140722291407, + "grad_norm": 0.6787802577018738, + "learning_rate": 0.00016179886210406728, + "loss": 0.23130471706390382, + "mean_token_accuracy": 0.9233332790434361, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3794369170832079, + "eval_loss": 0.6182110905647278, + "eval_mean_token_accuracy": 0.8495433777570724, + "eval_num_tokens": 3967474.0, + "eval_runtime": 85.94, + "eval_samples_per_second": 16.0, + "eval_steps_per_second": 2.001, + "step": 1700 + }, + { + "entropy": 0.3031421799212694, + "epoch": 4.2789539227895395, + "grad_norm": 0.9732038378715515, + "learning_rate": 0.0001600177774318036, + "loss": 0.2359529733657837, + "mean_token_accuracy": 0.9217648565769195, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3923123094231583, + "eval_loss": 0.6057384610176086, + "eval_mean_token_accuracy": 0.8508818288182103, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7647, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.29365369994193313, + "epoch": 4.328767123287671, + "grad_norm": 0.7681498527526855, + "learning_rate": 0.0001582225549793541, + "loss": 0.2269371747970581, + "mean_token_accuracy": 0.9245341829955578, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.4011661055129628, + "eval_loss": 0.6144486665725708, + "eval_mean_token_accuracy": 0.8480324357054955, + "eval_num_tokens": 4062594.0, + "eval_runtime": 87.1306, + "eval_samples_per_second": 15.781, + "eval_steps_per_second": 1.974, + "step": 1740 + }, + { + "entropy": 0.29396994728595016, + "epoch": 4.378580323785803, + "grad_norm": 1.0001007318496704, + "learning_rate": 0.0001564137361613248, + "loss": 0.22777395248413085, + "mean_token_accuracy": 0.9262309700250626, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38518730195802314, + "eval_loss": 0.6202630400657654, + "eval_mean_token_accuracy": 0.8493869807137999, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6616, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.3096018506214023, + "epoch": 4.428393524283935, + "grad_norm": 1.0448365211486816, + "learning_rate": 0.00015459186649280024, + "loss": 0.23696351051330566, + "mean_token_accuracy": 0.9217322513461113, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.3946371126140273, + "eval_loss": 0.6079026460647583, + "eval_mean_token_accuracy": 0.8492515852978063, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6582, + "eval_samples_per_second": 15.867, + "eval_steps_per_second": 1.985, + "step": 1780 + }, + { + "entropy": 0.32619857545942066, + "epoch": 4.478206724782067, + "grad_norm": 0.7210651636123657, + "learning_rate": 0.00015275749542482337, + "loss": 0.24651215076446534, + "mean_token_accuracy": 0.9177676141262054, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.3947690814560236, + "eval_loss": 0.6065912246704102, + "eval_mean_token_accuracy": 0.8502957744653835, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.5959, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.986, + "step": 1800 + }, + { + "entropy": 0.3193941755220294, + "epoch": 4.5280199252802, + "grad_norm": 0.8281906843185425, + "learning_rate": 0.0001509111761786888, + "loss": 0.23936262130737304, + "mean_token_accuracy": 0.9201708927750587, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38704028864239537, + "eval_loss": 0.6006569266319275, + "eval_mean_token_accuracy": 0.8502406720505205, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.8059, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1820 + }, + { + "entropy": 0.3164879363030195, + "epoch": 4.577833125778331, + "grad_norm": 0.7892968654632568, + "learning_rate": 0.00014905346557909867, + "loss": 0.24541733264923096, + "mean_token_accuracy": 0.9175932116806507, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.38861122120951497, + "eval_loss": 0.6115967631340027, + "eval_mean_token_accuracy": 0.849471275196519, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.2946, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1840 + }, + { + "entropy": 0.3051785985007882, + "epoch": 4.627646326276463, + "grad_norm": 0.8109654188156128, + "learning_rate": 0.0001471849238862319, + "loss": 0.23433220386505127, + "mean_token_accuracy": 0.9206570319831371, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.37162452295076015, + "eval_loss": 0.6184061765670776, + "eval_mean_token_accuracy": 0.8501173268223918, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.6865, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1860 + }, + { + "entropy": 0.3168198253959417, + "epoch": 4.677459526774595, + "grad_norm": 0.9512342214584351, + "learning_rate": 0.0001453061146267775, + "loss": 0.23832404613494873, + "mean_token_accuracy": 0.9197044663131237, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3845940856912801, + "eval_loss": 0.606762707233429, + "eval_mean_token_accuracy": 0.8504838194957999, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.5175, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 1880 + }, + { + "entropy": 0.30791807882487776, + "epoch": 4.7272727272727275, + "grad_norm": 0.8123113512992859, + "learning_rate": 0.00014341760442398248, + "loss": 0.2395785331726074, + "mean_token_accuracy": 0.918928150832653, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.39762327222283494, + "eval_loss": 0.5994202494621277, + "eval_mean_token_accuracy": 0.8509274201337681, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.2873, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.993, + "step": 1900 + }, + { + "entropy": 0.3021434534341097, + "epoch": 4.777085927770859, + "grad_norm": 0.731787383556366, + "learning_rate": 0.000141519962826766, + "loss": 0.23494718074798585, + "mean_token_accuracy": 0.9201403826475143, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.3827026732439219, + "eval_loss": 0.5995895862579346, + "eval_mean_token_accuracy": 0.851468373523202, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.3006, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 1920 + }, + { + "entropy": 0.31626159623265265, + "epoch": 4.826899128268991, + "grad_norm": 0.8848487138748169, + "learning_rate": 0.00013961376213795132, + "loss": 0.2439030647277832, + "mean_token_accuracy": 0.9196575872600079, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.388698436839636, + "eval_loss": 0.6000174283981323, + "eval_mean_token_accuracy": 0.8518068187458571, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.8979, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.979, + "step": 1940 + }, + { + "entropy": 0.30520407035946845, + "epoch": 4.876712328767123, + "grad_norm": 0.8532460927963257, + "learning_rate": 0.00013769957724166695, + "loss": 0.23458616733551024, + "mean_token_accuracy": 0.9221912942826748, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.38777847102908203, + "eval_loss": 0.6004981398582458, + "eval_mean_token_accuracy": 0.8516481768253238, + "eval_num_tokens": 4578167.0, + "eval_runtime": 87.0777, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.975, + "step": 1960 + }, + { + "entropy": 0.3226448342204094, + "epoch": 4.926525529265255, + "grad_norm": 0.6945561766624451, + "learning_rate": 0.0001357779854299694, + "loss": 0.24048397541046143, + "mean_token_accuracy": 0.9195300146937371, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.38581624263247777, + "eval_loss": 0.6029234528541565, + "eval_mean_token_accuracy": 0.8514213260523108, + "eval_num_tokens": 4622316.0, + "eval_runtime": 85.8729, + "eval_samples_per_second": 16.012, + "eval_steps_per_second": 2.003, + "step": 1980 + }, + { + "entropy": 0.3051655298098922, + "epoch": 4.976338729763388, + "grad_norm": 0.7976452708244324, + "learning_rate": 0.00013384956622874001, + "loss": 0.23584742546081544, + "mean_token_accuracy": 0.9216851457953453, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.37913159246361533, + "eval_loss": 0.6057604551315308, + "eval_mean_token_accuracy": 0.8525801203971686, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.1145, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 2000 + }, + { + "entropy": 0.27438195240803254, + "epoch": 5.024906600249066, + "grad_norm": 0.6729586124420166, + "learning_rate": 0.0001319149012229075, + "loss": 0.19775952100753785, + "mean_token_accuracy": 0.9339428559327737, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.3448961910813354, + "eval_loss": 0.6750120520591736, + "eval_mean_token_accuracy": 0.8487970232963562, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.1169, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 2020 + }, + { + "entropy": 0.21423916313797237, + "epoch": 5.074719800747198, + "grad_norm": 0.6934391856193542, + "learning_rate": 0.00012997457388105022, + "loss": 0.1439570426940918, + "mean_token_accuracy": 0.9528236843645572, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.3570949243771475, + "eval_loss": 0.6465504169464111, + "eval_mean_token_accuracy": 0.8490785547467166, + "eval_num_tokens": 4763269.0, + "eval_runtime": 85.9574, + "eval_samples_per_second": 15.996, + "eval_steps_per_second": 2.001, + "step": 2040 + }, + { + "entropy": 0.20838565267622472, + "epoch": 5.12453300124533, + "grad_norm": 0.7286986112594604, + "learning_rate": 0.00012802916937942972, + "loss": 0.14467307329177856, + "mean_token_accuracy": 0.950994835793972, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.3452463157821533, + "eval_loss": 0.6705958843231201, + "eval_mean_token_accuracy": 0.8490352796953778, + "eval_num_tokens": 4809047.0, + "eval_runtime": 86.228, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 2060 + }, + { + "entropy": 0.20453082229942082, + "epoch": 5.174346201743462, + "grad_norm": 0.7515555620193481, + "learning_rate": 0.00012607927442550974, + "loss": 0.13732000589370727, + "mean_token_accuracy": 0.9537357829511166, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.32431264914745506, + "eval_loss": 0.6743043065071106, + "eval_mean_token_accuracy": 0.8504878629085629, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.5948, + "eval_samples_per_second": 15.879, + "eval_steps_per_second": 1.986, + "step": 2080 + }, + { + "entropy": 0.21812320686876774, + "epoch": 5.224159402241594, + "grad_norm": 0.9093465209007263, + "learning_rate": 0.0001241254770810132, + "loss": 0.14311420917510986, + "mean_token_accuracy": 0.9514068141579628, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.33086285835435225, + "eval_loss": 0.6676449179649353, + "eval_mean_token_accuracy": 0.8505287662495015, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 2100 + }, + { + "entropy": 0.2180163251236081, + "epoch": 5.273972602739726, + "grad_norm": 0.6703007221221924, + "learning_rate": 0.00012216836658457075, + "loss": 0.14803968667984008, + "mean_token_accuracy": 0.9521303348243236, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.33162341708707255, + "eval_loss": 0.6658875942230225, + "eval_mean_token_accuracy": 0.8500757605530495, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.6296, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 2120 + }, + { + "entropy": 0.22511130161583423, + "epoch": 5.323785803237858, + "grad_norm": 0.8078880906105042, + "learning_rate": 0.00012020853317401455, + "loss": 0.15228408575057983, + "mean_token_accuracy": 0.947144789993763, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3354601170434508, + "eval_loss": 0.6677829623222351, + "eval_mean_token_accuracy": 0.8482600024273229, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.4689, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.989, + "step": 2140 + }, + { + "entropy": 0.2244176059961319, + "epoch": 5.37359900373599, + "grad_norm": 0.9636075496673584, + "learning_rate": 0.00011824656790837037, + "loss": 0.15260883569717407, + "mean_token_accuracy": 0.9471467643976211, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.3381616926297199, + "eval_loss": 0.6694412231445312, + "eval_mean_token_accuracy": 0.8482369603805764, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.4147, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 2160 + }, + { + "entropy": 0.22982364390045404, + "epoch": 5.423412204234122, + "grad_norm": 0.775401771068573, + "learning_rate": 0.00011628306248960262, + "loss": 0.15140302181243898, + "mean_token_accuracy": 0.9492553934454918, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.3305150235808173, + "eval_loss": 0.6717822551727295, + "eval_mean_token_accuracy": 0.8489849723355715, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.4728, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.989, + "step": 2180 + }, + { + "entropy": 0.21448935717344284, + "epoch": 5.473225404732254, + "grad_norm": 0.6575281023979187, + "learning_rate": 0.00011431860908416465, + "loss": 0.1452319622039795, + "mean_token_accuracy": 0.9505287684500218, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3488145174328671, + "eval_loss": 0.6612305641174316, + "eval_mean_token_accuracy": 0.8492907808963642, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6927, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 2200 + }, + { + "entropy": 0.23091202937066554, + "epoch": 5.523038605230386, + "grad_norm": 0.8909686207771301, + "learning_rate": 0.00011235380014440985, + "loss": 0.15150139331817628, + "mean_token_accuracy": 0.9497875183820724, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.3268539015810157, + "eval_loss": 0.6667542457580566, + "eval_mean_token_accuracy": 0.8499062903398691, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.4644, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 2220 + }, + { + "entropy": 0.2227974807843566, + "epoch": 5.572851805728518, + "grad_norm": 0.6180275082588196, + "learning_rate": 0.0001103892282299158, + "loss": 0.1491069197654724, + "mean_token_accuracy": 0.9488144010305405, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3346347655494546, + "eval_loss": 0.6665948629379272, + "eval_mean_token_accuracy": 0.8499961893918903, + "eval_num_tokens": 5226864.0, + "eval_runtime": 87.0548, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.976, + "step": 2240 + }, + { + "entropy": 0.21368421968072654, + "epoch": 5.62266500622665, + "grad_norm": 0.6004369258880615, + "learning_rate": 0.00010842548582877651, + "loss": 0.14485255479812623, + "mean_token_accuracy": 0.9502056457102299, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.32753298804163933, + "eval_loss": 0.6680151224136353, + "eval_mean_token_accuracy": 0.8515451086121936, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.8524, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.98, + "step": 2260 + }, + { + "entropy": 0.2103635374456644, + "epoch": 5.672478206724782, + "grad_norm": 0.699174702167511, + "learning_rate": 0.00010646316517891613, + "loss": 0.14297772645950318, + "mean_token_accuracy": 0.9512537539005279, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.32966585959806, + "eval_loss": 0.675578773021698, + "eval_mean_token_accuracy": 0.8509623023659684, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.4518, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.99, + "step": 2280 + }, + { + "entropy": 0.22516900151968003, + "epoch": 5.722291407222914, + "grad_norm": 0.6637354493141174, + "learning_rate": 0.00010450285808947797, + "loss": 0.15202572345733642, + "mean_token_accuracy": 0.9482452072203159, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3369456917740578, + "eval_loss": 0.6697061061859131, + "eval_mean_token_accuracy": 0.848603522361711, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.6371, + "eval_samples_per_second": 15.871, + "eval_steps_per_second": 1.985, + "step": 2300 + }, + { + "entropy": 0.21841065725311637, + "epoch": 5.772104607721046, + "grad_norm": 0.7940268516540527, + "learning_rate": 0.00010254515576234297, + "loss": 0.14710167646408082, + "mean_token_accuracy": 0.9493498183786869, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3237486180177955, + "eval_loss": 0.6779657602310181, + "eval_mean_token_accuracy": 0.8500715313955794, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.1826, + "eval_samples_per_second": 15.954, + "eval_steps_per_second": 1.996, + "step": 2320 + }, + { + "entropy": 0.22146204356104135, + "epoch": 5.821917808219178, + "grad_norm": 0.9234833121299744, + "learning_rate": 0.00010059064861383132, + "loss": 0.14720046520233154, + "mean_token_accuracy": 0.9493872679769992, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.32365207564692167, + "eval_loss": 0.6704005002975464, + "eval_mean_token_accuracy": 0.8507985760306203, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.5494, + "eval_samples_per_second": 15.887, + "eval_steps_per_second": 1.987, + "step": 2340 + }, + { + "entropy": 0.20934011954814197, + "epoch": 5.87173100871731, + "grad_norm": 0.5547503232955933, + "learning_rate": 9.863992609664084e-05, + "loss": 0.1464867353439331, + "mean_token_accuracy": 0.9503875687718392, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.3330401429083458, + "eval_loss": 0.6659091114997864, + "eval_mean_token_accuracy": 0.8504848906467127, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.5855, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 2360 + }, + { + "entropy": 0.21678635366261007, + "epoch": 5.921544209215442, + "grad_norm": 0.570612907409668, + "learning_rate": 9.669357652207635e-05, + "loss": 0.14821385145187377, + "mean_token_accuracy": 0.9503940217196941, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3322022325077722, + "eval_loss": 0.6722489595413208, + "eval_mean_token_accuracy": 0.8489979422369669, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.2986, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 2380 + }, + { + "entropy": 0.20932920072227718, + "epoch": 5.971357409713574, + "grad_norm": 0.7879557609558105, + "learning_rate": 9.475218688262262e-05, + "loss": 0.14675841331481934, + "mean_token_accuracy": 0.9507176131010056, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.3199348642902319, + "eval_loss": 0.6698136329650879, + "eval_mean_token_accuracy": 0.8514142130003419, + "eval_num_tokens": 5605400.0, + "eval_runtime": 85.8995, + "eval_samples_per_second": 16.007, + "eval_steps_per_second": 2.002, + "step": 2400 + }, + { + "entropy": 0.21032143919131693, + "epoch": 6.019925280199253, + "grad_norm": 0.5823076367378235, + "learning_rate": 9.281634267491569e-05, + "loss": 0.13322267532348633, + "mean_token_accuracy": 0.9550939072401096, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.30206270117399303, + "eval_loss": 0.7093168497085571, + "eval_mean_token_accuracy": 0.8500627639681794, + "eval_num_tokens": 5648968.0, + "eval_runtime": 85.8128, + "eval_samples_per_second": 16.023, + "eval_steps_per_second": 2.004, + "step": 2420 + }, + { + "entropy": 0.1534628233872354, + "epoch": 6.069738480697385, + "grad_norm": 0.710133969783783, + "learning_rate": 9.088662772316508e-05, + "loss": 0.09078952670097351, + "mean_token_accuracy": 0.9678447999060154, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.28208133101809857, + "eval_loss": 0.7636417150497437, + "eval_mean_token_accuracy": 0.8494061477655588, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9724, + "eval_samples_per_second": 15.994, + "eval_steps_per_second": 2.001, + "step": 2440 + }, + { + "entropy": 0.16151462448760867, + "epoch": 6.119551681195516, + "grad_norm": 0.5793812274932861, + "learning_rate": 8.896362400308028e-05, + "loss": 0.09545697569847107, + "mean_token_accuracy": 0.9671573750674725, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.2833245605403601, + "eval_loss": 0.7402405738830566, + "eval_mean_token_accuracy": 0.8503523728875226, + "eval_num_tokens": 5745090.0, + "eval_runtime": 85.5461, + "eval_samples_per_second": 16.073, + "eval_steps_per_second": 2.011, + "step": 2460 + }, + { + "entropy": 0.15203177919611335, + "epoch": 6.169364881693649, + "grad_norm": 0.4251123368740082, + "learning_rate": 8.704791146635483e-05, + "loss": 0.09420782327651978, + "mean_token_accuracy": 0.9677386932075024, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.28572545962971313, + "eval_loss": 0.735416829586029, + "eval_mean_token_accuracy": 0.8487084663884584, + "eval_num_tokens": 5790333.0, + "eval_runtime": 85.4801, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.012, + "step": 2480 + }, + { + "entropy": 0.15587336672469973, + "epoch": 6.219178082191781, + "grad_norm": 0.4357028007507324, + "learning_rate": 8.514006786576085e-05, + "loss": 0.09429320096969604, + "mean_token_accuracy": 0.9682952925562859, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.2859006894882335, + "eval_loss": 0.7347224950790405, + "eval_mean_token_accuracy": 0.8501905518215757, + "eval_num_tokens": 5837321.0, + "eval_runtime": 85.7578, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.006, + "step": 2500 + }, + { + "entropy": 0.15765639198943973, + "epoch": 6.268991282689913, + "grad_norm": 0.47331130504608154, + "learning_rate": 8.324066858090663e-05, + "loss": 0.09571113586425781, + "mean_token_accuracy": 0.9683481335639954, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.29231513846059176, + "eval_loss": 0.7392512559890747, + "eval_mean_token_accuracy": 0.8486633983462356, + "eval_num_tokens": 5884398.0, + "eval_runtime": 85.7846, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.005, + "step": 2520 + }, + { + "entropy": 0.16176860257983208, + "epoch": 6.318804483188045, + "grad_norm": 0.6142018437385559, + "learning_rate": 8.135028644470992e-05, + "loss": 0.09486144185066223, + "mean_token_accuracy": 0.9682316601276397, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.2851274753379267, + "eval_loss": 0.7520816922187805, + "eval_mean_token_accuracy": 0.8501113649717597, + "eval_num_tokens": 5929876.0, + "eval_runtime": 85.9425, + "eval_samples_per_second": 15.999, + "eval_steps_per_second": 2.001, + "step": 2540 + }, + { + "entropy": 0.15404034564271568, + "epoch": 6.3686176836861765, + "grad_norm": 0.6051287651062012, + "learning_rate": 7.946949157063964e-05, + "loss": 0.09280472993850708, + "mean_token_accuracy": 0.9684635892510414, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28802703563557114, + "eval_loss": 0.7439162135124207, + "eval_mean_token_accuracy": 0.8499851770872293, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.0703, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.998, + "step": 2560 + }, + { + "entropy": 0.15343588953837753, + "epoch": 6.418430884184309, + "grad_norm": 0.4823743402957916, + "learning_rate": 7.759885118077701e-05, + "loss": 0.09000591039657593, + "mean_token_accuracy": 0.9699928767979145, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2795634938533916, + "eval_loss": 0.7647850513458252, + "eval_mean_token_accuracy": 0.8503464397995971, + "eval_num_tokens": 6025380.0, + "eval_runtime": 85.8886, + "eval_samples_per_second": 16.009, + "eval_steps_per_second": 2.003, + "step": 2580 + }, + { + "entropy": 0.15740026142448188, + "epoch": 6.468244084682441, + "grad_norm": 0.5082696676254272, + "learning_rate": 7.57389294347494e-05, + "loss": 0.09191849827766418, + "mean_token_accuracy": 0.9692809768021107, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2913342311458532, + "eval_loss": 0.7518694996833801, + "eval_mean_token_accuracy": 0.8483168302580367, + "eval_num_tokens": 6073349.0, + "eval_runtime": 85.5761, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.01, + "step": 2600 + }, + { + "entropy": 0.15922069251537324, + "epoch": 6.518057285180573, + "grad_norm": 0.3995199501514435, + "learning_rate": 7.389028725958736e-05, + "loss": 0.09584367871284485, + "mean_token_accuracy": 0.9685114495456218, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.2863075934177221, + "eval_loss": 0.7539381384849548, + "eval_mean_token_accuracy": 0.8507507083027862, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.112, + "eval_samples_per_second": 15.968, + "eval_steps_per_second": 1.997, + "step": 2620 + }, + { + "entropy": 0.16197575423866512, + "epoch": 6.567870485678705, + "grad_norm": 0.534295380115509, + "learning_rate": 7.205348218055678e-05, + "loss": 0.0961170256137848, + "mean_token_accuracy": 0.9674530044198036, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.29021967315050057, + "eval_loss": 0.751198947429657, + "eval_mean_token_accuracy": 0.8509796344956686, + "eval_num_tokens": 6165523.0, + "eval_runtime": 85.7958, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.005, + "step": 2640 + }, + { + "entropy": 0.15261746793985367, + "epoch": 6.617683686176837, + "grad_norm": 0.5391237139701843, + "learning_rate": 7.022906815301673e-05, + "loss": 0.0926026999950409, + "mean_token_accuracy": 0.9695659473538398, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.29128045216202736, + "eval_loss": 0.7450292110443115, + "eval_mean_token_accuracy": 0.8498771443616512, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.3963, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 2660 + }, + { + "entropy": 0.16164180357009172, + "epoch": 6.667496886674969, + "grad_norm": 0.5767946243286133, + "learning_rate": 6.841759539535419e-05, + "loss": 0.09291981458663941, + "mean_token_accuracy": 0.9687136687338352, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2897637223088464, + "eval_loss": 0.7503410577774048, + "eval_mean_token_accuracy": 0.8503315164599308, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.0653, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.998, + "step": 2680 + }, + { + "entropy": 0.17062523355707526, + "epoch": 6.717310087173101, + "grad_norm": 0.4974168539047241, + "learning_rate": 6.661961022304563e-05, + "loss": 0.09713236689567566, + "mean_token_accuracy": 0.9661971725523472, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2765843396963075, + "eval_loss": 0.7604002356529236, + "eval_mean_token_accuracy": 0.8521115277395692, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.1676, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 2700 + }, + { + "entropy": 0.17544092936441302, + "epoch": 6.767123287671232, + "grad_norm": 0.5523537993431091, + "learning_rate": 6.483565488389582e-05, + "loss": 0.09709116220474243, + "mean_token_accuracy": 0.9650957375764847, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.27939334659035814, + "eval_loss": 0.7534670829772949, + "eval_mean_token_accuracy": 0.851230604010959, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.2913, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 2720 + }, + { + "entropy": 0.15991022661328316, + "epoch": 6.816936488169365, + "grad_norm": 0.478551983833313, + "learning_rate": 6.306626739450311e-05, + "loss": 0.09564646482467651, + "mean_token_accuracy": 0.9679084822535515, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.27878295491601146, + "eval_loss": 0.7519959211349487, + "eval_mean_token_accuracy": 0.8510654949864676, + "eval_num_tokens": 6397720.0, + "eval_runtime": 85.9109, + "eval_samples_per_second": 16.005, + "eval_steps_per_second": 2.002, + "step": 2740 + }, + { + "entropy": 0.16824879590421915, + "epoch": 6.866749688667497, + "grad_norm": 0.6681098937988281, + "learning_rate": 6.131198137800108e-05, + "loss": 0.0962279736995697, + "mean_token_accuracy": 0.966830012947321, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.2834690434121808, + "eval_loss": 0.751922070980072, + "eval_mean_token_accuracy": 0.8521237577809844, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.3618, + "eval_samples_per_second": 15.921, + "eval_steps_per_second": 1.992, + "step": 2760 + }, + { + "entropy": 0.1518704930320382, + "epoch": 6.916562889165629, + "grad_norm": 0.5201290249824524, + "learning_rate": 5.957332590312513e-05, + "loss": 0.09010660648345947, + "mean_token_accuracy": 0.9693463340401649, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.28485129617674404, + "eval_loss": 0.7452457547187805, + "eval_mean_token_accuracy": 0.8512036796919135, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.4524, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.99, + "step": 2780 + }, + { + "entropy": 0.15512610590085388, + "epoch": 6.966376089663761, + "grad_norm": 0.42802050709724426, + "learning_rate": 5.785082532465233e-05, + "loss": 0.09320432543754578, + "mean_token_accuracy": 0.9686134628951549, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.27554594526110693, + "eval_loss": 0.7644653916358948, + "eval_mean_token_accuracy": 0.8513738523389018, + "eval_num_tokens": 6540175.0, + "eval_runtime": 85.7609, + "eval_samples_per_second": 16.033, + "eval_steps_per_second": 2.006, + "step": 2800 + }, + { + "entropy": 0.17524497526196334, + "epoch": 7.01494396014944, + "grad_norm": 0.3330269157886505, + "learning_rate": 5.6144999125263545e-05, + "loss": 0.0895616888999939, + "mean_token_accuracy": 0.9682766932707566, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.2735865569218647, + "eval_loss": 0.768479585647583, + "eval_mean_token_accuracy": 0.8503459383581959, + "eval_num_tokens": 6583767.0, + "eval_runtime": 85.7162, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.007, + "step": 2820 + }, + { + "entropy": 0.1403565663844347, + "epoch": 7.064757160647572, + "grad_norm": 0.35613498091697693, + "learning_rate": 5.4456361758874235e-05, + "loss": 0.07551313638687134, + "mean_token_accuracy": 0.9739301167428493, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.25941789089593775, + "eval_loss": 0.8209511637687683, + "eval_mean_token_accuracy": 0.8505055855873019, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.0943, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 2840 + }, + { + "entropy": 0.13500106502324344, + "epoch": 7.114570361145703, + "grad_norm": 0.34418627619743347, + "learning_rate": 5.2785422495482234e-05, + "loss": 0.07293946146965027, + "mean_token_accuracy": 0.9747208289802074, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.26482899772912954, + "eval_loss": 0.798904538154602, + "eval_mean_token_accuracy": 0.8511530233677044, + "eval_num_tokens": 6672946.0, + "eval_runtime": 85.7915, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.005, + "step": 2860 + }, + { + "entropy": 0.13127502552233636, + "epoch": 7.164383561643835, + "grad_norm": 0.4638441503047943, + "learning_rate": 5.113268526757892e-05, + "loss": 0.07121461629867554, + "mean_token_accuracy": 0.9756786689162255, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2645381211714689, + "eval_loss": 0.809101939201355, + "eval_mean_token_accuracy": 0.8514727898115335, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.84, + "eval_samples_per_second": 16.018, + "eval_steps_per_second": 2.004, + "step": 2880 + }, + { + "entropy": 0.1331390908919275, + "epoch": 7.214196762141968, + "grad_norm": 0.40206775069236755, + "learning_rate": 4.949864851817007e-05, + "loss": 0.07188264131546021, + "mean_token_accuracy": 0.9755406074225903, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.26244733283339544, + "eval_loss": 0.8143188953399658, + "eval_mean_token_accuracy": 0.8514358189909957, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.8546, + "eval_samples_per_second": 16.015, + "eval_steps_per_second": 2.003, + "step": 2900 + }, + { + "entropy": 0.13647331558167936, + "epoch": 7.2640099626401, + "grad_norm": 0.26405787467956543, + "learning_rate": 4.788380505045224e-05, + "loss": 0.07412450313568116, + "mean_token_accuracy": 0.9744274213910102, + "num_tokens": 6809678.0, + "step": 2920 + }, + { + "epoch": 7.2640099626401, + "eval_entropy": 0.2626111418182074, + "eval_loss": 0.8111525177955627, + "eval_mean_token_accuracy": 0.8512121695418691, + "eval_num_tokens": 6809678.0, + "eval_runtime": 85.9626, + "eval_samples_per_second": 15.995, + "eval_steps_per_second": 2.001, + "step": 2920 + }, + { + "entropy": 0.12644002586603165, + "epoch": 7.313823163138232, + "grad_norm": 0.27514681220054626, + "learning_rate": 4.6288641879189884e-05, + "loss": 0.06807711124420165, + "mean_token_accuracy": 0.9760703906416893, + "num_tokens": 6860750.0, + "step": 2940 + }, + { + "epoch": 7.313823163138232, + "eval_entropy": 0.26096762734097106, + "eval_loss": 0.8184595108032227, + "eval_mean_token_accuracy": 0.8501476153384807, + "eval_num_tokens": 6860750.0, + "eval_runtime": 85.9521, + "eval_samples_per_second": 15.997, + "eval_steps_per_second": 2.001, + "step": 2940 + }, + { + "entropy": 0.13920630998909472, + "epoch": 7.363636363636363, + "grad_norm": 0.23584705591201782, + "learning_rate": 4.4713640083838604e-05, + "loss": 0.07301607131958007, + "mean_token_accuracy": 0.9745715200901032, + "num_tokens": 6907092.0, + "step": 2960 + }, + { + "epoch": 7.363636363636363, + "eval_entropy": 0.2612536767021168, + "eval_loss": 0.8116245269775391, + "eval_mean_token_accuracy": 0.8510967350976412, + "eval_num_tokens": 6907092.0, + "eval_runtime": 85.6373, + "eval_samples_per_second": 16.056, + "eval_steps_per_second": 2.008, + "step": 2960 + }, + { + "entropy": 0.1349492883309722, + "epoch": 7.4134495641344955, + "grad_norm": 0.24552719295024872, + "learning_rate": 4.315927466345791e-05, + "loss": 0.07397544980049134, + "mean_token_accuracy": 0.9745095103979111, + "num_tokens": 6952700.0, + "step": 2980 + }, + { + "epoch": 7.4134495641344955, + "eval_entropy": 0.25796533306670744, + "eval_loss": 0.8266491293907166, + "eval_mean_token_accuracy": 0.8511653857868772, + "eval_num_tokens": 6952700.0, + "eval_runtime": 85.7462, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.006, + "step": 2980 + }, + { + "entropy": 0.14479175000451505, + "epoch": 7.463262764632628, + "grad_norm": 0.2846072018146515, + "learning_rate": 4.162601439345814e-05, + "loss": 0.07544798254966736, + "mean_token_accuracy": 0.9727819666266442, + "num_tokens": 6996430.0, + "step": 3000 + }, + { + "epoch": 7.463262764632628, + "eval_entropy": 0.2584348309698493, + "eval_loss": 0.8253348469734192, + "eval_mean_token_accuracy": 0.8511569815319638, + "eval_num_tokens": 6996430.0, + "eval_runtime": 86.2984, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 3000 + }, + { + "entropy": 0.14114196319133043, + "epoch": 7.51307596513076, + "grad_norm": 0.407966285943985, + "learning_rate": 4.011432168422419e-05, + "loss": 0.0736398994922638, + "mean_token_accuracy": 0.9741654269397259, + "num_tokens": 7042038.0, + "step": 3020 + }, + { + "epoch": 7.51307596513076, + "eval_entropy": 0.25232676260693127, + "eval_loss": 0.8296052813529968, + "eval_mean_token_accuracy": 0.8523298349491385, + "eval_num_tokens": 7042038.0, + "eval_runtime": 85.8445, + "eval_samples_per_second": 16.017, + "eval_steps_per_second": 2.004, + "step": 3020 + }, + { + "entropy": 0.1353456223383546, + "epoch": 7.562889165628892, + "grad_norm": 0.2712634801864624, + "learning_rate": 3.8624652441658684e-05, + "loss": 0.07362412214279175, + "mean_token_accuracy": 0.9747945807874203, + "num_tokens": 7089390.0, + "step": 3040 + }, + { + "epoch": 7.562889165628892, + "eval_entropy": 0.2579477243991785, + "eval_loss": 0.8274564743041992, + "eval_mean_token_accuracy": 0.8517705212498821, + "eval_num_tokens": 7089390.0, + "eval_runtime": 85.8222, + "eval_samples_per_second": 16.022, + "eval_steps_per_second": 2.004, + "step": 3040 + }, + { + "entropy": 0.1296080862637609, + "epoch": 7.6127023661270234, + "grad_norm": 0.2371893972158432, + "learning_rate": 3.715745592968707e-05, + "loss": 0.06971035599708557, + "mean_token_accuracy": 0.9759043246507645, + "num_tokens": 7138002.0, + "step": 3060 + }, + { + "epoch": 7.6127023661270234, + "eval_entropy": 0.25391967083479083, + "eval_loss": 0.8197130560874939, + "eval_mean_token_accuracy": 0.8522267875283264, + "eval_num_tokens": 7138002.0, + "eval_runtime": 85.8796, + "eval_samples_per_second": 16.011, + "eval_steps_per_second": 2.003, + "step": 3060 + }, + { + "entropy": 0.1311203008517623, + "epoch": 7.662515566625156, + "grad_norm": 0.22499267756938934, + "learning_rate": 3.5713174634765967e-05, + "loss": 0.07176244258880615, + "mean_token_accuracy": 0.9754939571022987, + "num_tokens": 7185520.0, + "step": 3080 + }, + { + "epoch": 7.662515566625156, + "eval_entropy": 0.2526215241225653, + "eval_loss": 0.8265154361724854, + "eval_mean_token_accuracy": 0.8519952584837758, + "eval_num_tokens": 7185520.0, + "eval_runtime": 85.8746, + "eval_samples_per_second": 16.012, + "eval_steps_per_second": 2.003, + "step": 3080 + }, + { + "entropy": 0.13420484317466616, + "epoch": 7.712328767123288, + "grad_norm": 0.2398064285516739, + "learning_rate": 3.4292244132434866e-05, + "loss": 0.07559212446212768, + "mean_token_accuracy": 0.9743142127990723, + "num_tokens": 7232170.0, + "step": 3100 + }, + { + "epoch": 7.712328767123288, + "eval_entropy": 0.2484562756537005, + "eval_loss": 0.8312150239944458, + "eval_mean_token_accuracy": 0.8528405119513356, + "eval_num_tokens": 7232170.0, + "eval_runtime": 85.7896, + "eval_samples_per_second": 16.028, + "eval_steps_per_second": 2.005, + "step": 3100 + }, + { + "entropy": 0.11965563679113984, + "epoch": 7.76214196762142, + "grad_norm": 0.3408384919166565, + "learning_rate": 3.2895092955952746e-05, + "loss": 0.0661750853061676, + "mean_token_accuracy": 0.9776600524783134, + "num_tokens": 7282846.0, + "step": 3120 + }, + { + "epoch": 7.76214196762142, + "eval_entropy": 0.2522421533804993, + "eval_loss": 0.8327009677886963, + "eval_mean_token_accuracy": 0.8524222023958383, + "eval_num_tokens": 7282846.0, + "eval_runtime": 86.1769, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 1.996, + "step": 3120 + }, + { + "entropy": 0.13388084415346385, + "epoch": 7.811955168119551, + "grad_norm": 0.35418516397476196, + "learning_rate": 3.152214246705829e-05, + "loss": 0.07149899601936341, + "mean_token_accuracy": 0.9747635535895824, + "num_tokens": 7331518.0, + "step": 3140 + }, + { + "epoch": 7.811955168119551, + "eval_entropy": 0.25038352296795957, + "eval_loss": 0.836457371711731, + "eval_mean_token_accuracy": 0.8526130665180295, + "eval_num_tokens": 7331518.0, + "eval_runtime": 85.6099, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.009, + "step": 3140 + }, + { + "entropy": 0.13530643959529698, + "epoch": 7.861768368617684, + "grad_norm": 0.38060539960861206, + "learning_rate": 3.017380672889291e-05, + "loss": 0.07116585969924927, + "mean_token_accuracy": 0.973284512758255, + "num_tokens": 7379056.0, + "step": 3160 + }, + { + "epoch": 7.861768368617684, + "eval_entropy": 0.255092611319797, + "eval_loss": 0.8314701914787292, + "eval_mean_token_accuracy": 0.8520913099826768, + "eval_num_tokens": 7379056.0, + "eval_runtime": 85.877, + "eval_samples_per_second": 16.011, + "eval_steps_per_second": 2.003, + "step": 3160 + }, + { + "entropy": 0.13383390177041293, + "epoch": 7.911581569115816, + "grad_norm": 0.3827536106109619, + "learning_rate": 2.8850492381124808e-05, + "loss": 0.07305437326431274, + "mean_token_accuracy": 0.9750778004527092, + "num_tokens": 7424770.0, + "step": 3180 + }, + { + "epoch": 7.911581569115816, + "eval_entropy": 0.25416371157003004, + "eval_loss": 0.8206402063369751, + "eval_mean_token_accuracy": 0.852779901651449, + "eval_num_tokens": 7424770.0, + "eval_runtime": 86.1015, + "eval_samples_per_second": 15.97, + "eval_steps_per_second": 1.998, + "step": 3180 + }, + { + "entropy": 0.1395680439658463, + "epoch": 7.961394769613948, + "grad_norm": 0.3809775412082672, + "learning_rate": 2.7552598517312256e-05, + "loss": 0.07236042022705078, + "mean_token_accuracy": 0.9731538116931915, + "num_tokens": 7470804.0, + "step": 3200 + }, + { + "epoch": 7.961394769613948, + "eval_entropy": 0.25528111975899964, + "eval_loss": 0.8230037093162537, + "eval_mean_token_accuracy": 0.8526452603035195, + "eval_num_tokens": 7470804.0, + "eval_runtime": 85.7895, + "eval_samples_per_second": 16.028, + "eval_steps_per_second": 2.005, + "step": 3200 + }, + { + "entropy": 0.12193699864049752, + "epoch": 8.009962640099626, + "grad_norm": 0.11854425817728043, + "learning_rate": 2.6280516564542205e-05, + "loss": 0.06617764234542847, + "mean_token_accuracy": 0.977179691577569, + "num_tokens": 7518110.0, + "step": 3220 + }, + { + "epoch": 8.009962640099626, + "eval_entropy": 0.25100527677771656, + "eval_loss": 0.8393343687057495, + "eval_mean_token_accuracy": 0.8522553132023922, + "eval_num_tokens": 7518110.0, + "eval_runtime": 85.8837, + "eval_samples_per_second": 16.01, + "eval_steps_per_second": 2.003, + "step": 3220 + }, + { + "entropy": 0.12788885813206435, + "epoch": 8.059775840597759, + "grad_norm": 0.16094881296157837, + "learning_rate": 2.50346301653812e-05, + "loss": 0.06274186968803405, + "mean_token_accuracy": 0.9766994707286358, + "num_tokens": 7565539.0, + "step": 3240 + }, + { + "epoch": 8.059775840597759, + "eval_entropy": 0.24409458682287571, + "eval_loss": 0.874617338180542, + "eval_mean_token_accuracy": 0.8521041180505309, + "eval_num_tokens": 7565539.0, + "eval_runtime": 86.2656, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 3240 + }, + { + "entropy": 0.12464155335910618, + "epoch": 8.10958904109589, + "grad_norm": 0.16893954575061798, + "learning_rate": 2.381531506217437e-05, + "loss": 0.06093020439147949, + "mean_token_accuracy": 0.9776258453726768, + "num_tokens": 7612578.0, + "step": 3260 + }, + { + "epoch": 8.10958904109589, + "eval_entropy": 0.24396493017326953, + "eval_loss": 0.891161322593689, + "eval_mean_token_accuracy": 0.8515338024427724, + "eval_num_tokens": 7612578.0, + "eval_runtime": 85.9061, + "eval_samples_per_second": 16.006, + "eval_steps_per_second": 2.002, + "step": 3260 + }, + { + "entropy": 0.12345920228399336, + "epoch": 8.159402241594023, + "grad_norm": 0.14332273602485657, + "learning_rate": 2.262293898372616e-05, + "loss": 0.061289966106414795, + "mean_token_accuracy": 0.9762230902910233, + "num_tokens": 7660157.0, + "step": 3280 + }, + { + "epoch": 8.159402241594023, + "eval_entropy": 0.2481445314059424, + "eval_loss": 0.8922848105430603, + "eval_mean_token_accuracy": 0.8514944855556932, + "eval_num_tokens": 7660157.0, + "eval_runtime": 85.5201, + "eval_samples_per_second": 16.078, + "eval_steps_per_second": 2.011, + "step": 3280 + }, + { + "entropy": 0.12298110066913068, + "epoch": 8.209215442092155, + "grad_norm": 0.21848882734775543, + "learning_rate": 2.1457861534398633e-05, + "loss": 0.05986443758010864, + "mean_token_accuracy": 0.9786281704902648, + "num_tokens": 7709745.0, + "step": 3300 + }, + { + "epoch": 8.209215442092155, + "eval_entropy": 0.24329388124305149, + "eval_loss": 0.9021085500717163, + "eval_mean_token_accuracy": 0.8521762625422589, + "eval_num_tokens": 7709745.0, + "eval_runtime": 85.955, + "eval_samples_per_second": 15.997, + "eval_steps_per_second": 2.001, + "step": 3300 + }, + { + "entropy": 0.13265180448070168, + "epoch": 8.259028642590286, + "grad_norm": 0.18067947030067444, + "learning_rate": 2.0320434085659692e-05, + "loss": 0.06724961400032044, + "mean_token_accuracy": 0.975098168104887, + "num_tokens": 7753571.0, + "step": 3320 + }, + { + "epoch": 8.259028642590286, + "eval_entropy": 0.2433211464694766, + "eval_loss": 0.9094350337982178, + "eval_mean_token_accuracy": 0.8520150094531304, + "eval_num_tokens": 7753571.0, + "eval_runtime": 85.7989, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.005, + "step": 3320 + }, + { + "entropy": 0.11949320202693343, + "epoch": 8.308841843088418, + "grad_norm": 0.17020289599895477, + "learning_rate": 1.9210999670114196e-05, + "loss": 0.0634455680847168, + "mean_token_accuracy": 0.9771294385194779, + "num_tokens": 7799310.0, + "step": 3340 + }, + { + "epoch": 8.308841843088418, + "eval_entropy": 0.24345201219237128, + "eval_loss": 0.9021793603897095, + "eval_mean_token_accuracy": 0.8520745697409607, + "eval_num_tokens": 7799310.0, + "eval_runtime": 86.0883, + "eval_samples_per_second": 15.972, + "eval_steps_per_second": 1.998, + "step": 3340 + }, + { + "entropy": 0.12065747743472457, + "epoch": 8.35865504358655, + "grad_norm": 0.16789060831069946, + "learning_rate": 1.8129892878049886e-05, + "loss": 0.061494195461273195, + "mean_token_accuracy": 0.9779584899544715, + "num_tokens": 7846447.0, + "step": 3360 + }, + { + "epoch": 8.35865504358655, + "eval_entropy": 0.24093415042342142, + "eval_loss": 0.9006755352020264, + "eval_mean_token_accuracy": 0.852174230786257, + "eval_num_tokens": 7846447.0, + "eval_runtime": 85.9011, + "eval_samples_per_second": 16.007, + "eval_steps_per_second": 2.002, + "step": 3360 + }, + { + "entropy": 0.13125578537583352, + "epoch": 8.408468244084682, + "grad_norm": 0.1662452220916748, + "learning_rate": 1.70774397565298e-05, + "loss": 0.06685600876808166, + "mean_token_accuracy": 0.9744067586958408, + "num_tokens": 7890283.0, + "step": 3380 + }, + { + "epoch": 8.408468244084682, + "eval_entropy": 0.24062153688350388, + "eval_loss": 0.9078915119171143, + "eval_mean_token_accuracy": 0.8523201647886011, + "eval_num_tokens": 7890283.0, + "eval_runtime": 86.0201, + "eval_samples_per_second": 15.985, + "eval_steps_per_second": 2.0, + "step": 3380 + }, + { + "entropy": 0.11986117120832204, + "epoch": 8.458281444582815, + "grad_norm": 0.19571948051452637, + "learning_rate": 1.6053957711060606e-05, + "loss": 0.06411095261573792, + "mean_token_accuracy": 0.9770627245306969, + "num_tokens": 7936518.0, + "step": 3400 + }, + { + "epoch": 8.458281444582815, + "eval_entropy": 0.24352820347561394, + "eval_loss": 0.9058943390846252, + "eval_mean_token_accuracy": 0.8519382792156797, + "eval_num_tokens": 7936518.0, + "eval_runtime": 85.966, + "eval_samples_per_second": 15.995, + "eval_steps_per_second": 2.001, + "step": 3400 + }, + { + "entropy": 0.12857897616922856, + "epoch": 8.508094645080947, + "grad_norm": 0.2609264850616455, + "learning_rate": 1.5059755409867613e-05, + "loss": 0.06473397612571716, + "mean_token_accuracy": 0.9764650195837021, + "num_tokens": 7981966.0, + "step": 3420 + }, + { + "epoch": 8.508094645080947, + "eval_entropy": 0.24032609000108962, + "eval_loss": 0.9077776074409485, + "eval_mean_token_accuracy": 0.8517829197090726, + "eval_num_tokens": 7981966.0, + "eval_runtime": 86.6059, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 3420 + }, + { + "entropy": 0.12348870886489749, + "epoch": 8.557907845579079, + "grad_norm": 0.19537609815597534, + "learning_rate": 1.409513269080473e-05, + "loss": 0.06481348872184753, + "mean_token_accuracy": 0.9769559659063816, + "num_tokens": 8028367.0, + "step": 3440 + }, + { + "epoch": 8.557907845579079, + "eval_entropy": 0.2404322574824788, + "eval_loss": 0.9057720899581909, + "eval_mean_token_accuracy": 0.8521037981953732, + "eval_num_tokens": 8028367.0, + "eval_runtime": 86.166, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.996, + "step": 3440 + }, + { + "entropy": 0.12040232736617326, + "epoch": 8.607721046077211, + "grad_norm": 0.3310582935810089, + "learning_rate": 1.3160380470927183e-05, + "loss": 0.06468871235847473, + "mean_token_accuracy": 0.9768650442361831, + "num_tokens": 8074934.0, + "step": 3460 + }, + { + "epoch": 8.607721046077211, + "eval_entropy": 0.24118655876711356, + "eval_loss": 0.9028318524360657, + "eval_mean_token_accuracy": 0.8521025340224422, + "eval_num_tokens": 8074934.0, + "eval_runtime": 85.3668, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.015, + "step": 3460 + }, + { + "entropy": 0.12328103906475008, + "epoch": 8.657534246575342, + "grad_norm": 0.12836167216300964, + "learning_rate": 1.2255780658755122e-05, + "loss": 0.06229386329650879, + "mean_token_accuracy": 0.9763277888298034, + "num_tokens": 8122775.0, + "step": 3480 + }, + { + "epoch": 8.657534246575342, + "eval_entropy": 0.24194598145956217, + "eval_loss": 0.9009329080581665, + "eval_mean_token_accuracy": 0.8521693289973015, + "eval_num_tokens": 8122775.0, + "eval_runtime": 85.9415, + "eval_samples_per_second": 15.999, + "eval_steps_per_second": 2.001, + "step": 3480 + }, + { + "entropy": 0.11321646976284683, + "epoch": 8.707347447073474, + "grad_norm": 0.15656894445419312, + "learning_rate": 1.1381606069253786e-05, + "loss": 0.05908188819885254, + "mean_token_accuracy": 0.9779504477977753, + "num_tokens": 8174307.0, + "step": 3500 + }, + { + "epoch": 8.707347447073474, + "eval_entropy": 0.24121542517528977, + "eval_loss": 0.9016091823577881, + "eval_mean_token_accuracy": 0.8521790667328724, + "eval_num_tokens": 8174307.0, + "eval_runtime": 85.7465, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.006, + "step": 3500 + }, + { + "entropy": 0.12657046681270004, + "epoch": 8.757160647571606, + "grad_norm": 0.22597502171993256, + "learning_rate": 1.053812034155629e-05, + "loss": 0.06244581937789917, + "mean_token_accuracy": 0.976795207709074, + "num_tokens": 8222808.0, + "step": 3520 + }, + { + "epoch": 8.757160647571606, + "eval_entropy": 0.23877542708502258, + "eval_loss": 0.9069110155105591, + "eval_mean_token_accuracy": 0.8522880177858264, + "eval_num_tokens": 8222808.0, + "eval_runtime": 85.7792, + "eval_samples_per_second": 16.03, + "eval_steps_per_second": 2.005, + "step": 3520 + }, + { + "entropy": 0.11422101808711886, + "epoch": 8.806973848069738, + "grad_norm": 0.21139323711395264, + "learning_rate": 9.725577859453502e-06, + "loss": 0.05988085865974426, + "mean_token_accuracy": 0.9779510758817196, + "num_tokens": 8273335.0, + "step": 3540 + }, + { + "epoch": 8.806973848069738, + "eval_entropy": 0.2393161087881687, + "eval_loss": 0.9033801555633545, + "eval_mean_token_accuracy": 0.8522614209457885, + "eval_num_tokens": 8273335.0, + "eval_runtime": 85.5594, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 3540 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.4923127305342566e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3560/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3560/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3560/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3560/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3560/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3560/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3560/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3560/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3560/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3560/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3560/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3560/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3560/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3560/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..2cb49980d844e1bc4a83cad951e198314aca95c4 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3560/trainer_state.json @@ -0,0 +1,3772 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 8.85678704856787, + "eval_steps": 20, + "global_step": 3560, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + }, + { + "entropy": 0.561330484598875, + "epoch": 1.891656288916563, + "grad_norm": 0.6722865700721741, + "learning_rate": 0.0002208867897174789, + "loss": 0.499837589263916, + "mean_token_accuracy": 0.8518734864890576, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.5865232653396074, + "eval_loss": 0.5437926650047302, + "eval_mean_token_accuracy": 0.8450997017843779, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4116, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.547389242425561, + "epoch": 1.9414694894146949, + "grad_norm": 0.7935577034950256, + "learning_rate": 0.00022027119820226907, + "loss": 0.4977591514587402, + "mean_token_accuracy": 0.8539491161704064, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.5290903090391048, + "eval_loss": 0.5409526824951172, + "eval_mean_token_accuracy": 0.8497545698354411, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.7262, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 780 + }, + { + "entropy": 0.5687909748405218, + "epoch": 1.9912826899128269, + "grad_norm": 0.6180546283721924, + "learning_rate": 0.00021962329729698345, + "loss": 0.5109643459320068, + "mean_token_accuracy": 0.8521598495543004, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.5503541858390321, + "eval_loss": 0.5361555218696594, + "eval_mean_token_accuracy": 0.8510884285666221, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.3339, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 800 + }, + { + "entropy": 0.4739728841261986, + "epoch": 2.0398505603985058, + "grad_norm": 0.8058829307556152, + "learning_rate": 0.0002189432823996982, + "loss": 0.4204097747802734, + "mean_token_accuracy": 0.8728981889211215, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.5077334992414297, + "eval_loss": 0.5531114339828491, + "eval_mean_token_accuracy": 0.8489257208136625, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.4801, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.989, + "step": 820 + }, + { + "entropy": 0.4594309840351343, + "epoch": 2.0896637608966375, + "grad_norm": 0.6906896829605103, + "learning_rate": 0.0002182313585936314, + "loss": 0.4071959495544434, + "mean_token_accuracy": 0.8732857562601566, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.49850136994622474, + "eval_loss": 0.5486204624176025, + "eval_mean_token_accuracy": 0.8507991450470548, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.3364, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.4881629109382629, + "epoch": 2.1394769613947697, + "grad_norm": 0.6343470215797424, + "learning_rate": 0.0002174877405852928, + "loss": 0.41669540405273436, + "mean_token_accuracy": 0.8711295068264008, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.49155513924914734, + "eval_loss": 0.555109441280365, + "eval_mean_token_accuracy": 0.8496399400539176, + "eval_num_tokens": 2008562.0, + "eval_runtime": 86.3295, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 860 + }, + { + "entropy": 0.4648668970912695, + "epoch": 2.1892901618929015, + "grad_norm": 0.8014165163040161, + "learning_rate": 0.00021671265263973133, + "loss": 0.4110250473022461, + "mean_token_accuracy": 0.8754166305065155, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.4909258722219356, + "eval_loss": 0.5539511442184448, + "eval_mean_token_accuracy": 0.8492401502160138, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.3468, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 880 + }, + { + "entropy": 0.4824485514312983, + "epoch": 2.2391033623910337, + "grad_norm": 0.6665191054344177, + "learning_rate": 0.00021590632851289967, + "loss": 0.4181404113769531, + "mean_token_accuracy": 0.8726993151009083, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.4986876940657926, + "eval_loss": 0.547695517539978, + "eval_mean_token_accuracy": 0.8501384708770486, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.3838, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 900 + }, + { + "entropy": 0.4751896943897009, + "epoch": 2.2889165628891655, + "grad_norm": 0.81158047914505, + "learning_rate": 0.00021506901138115678, + "loss": 0.40689678192138673, + "mean_token_accuracy": 0.8745221219956875, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.507153491121392, + "eval_loss": 0.5501641631126404, + "eval_mean_token_accuracy": 0.8495670116918032, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.0912, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 920 + }, + { + "entropy": 0.4873133715242147, + "epoch": 2.3387297633872977, + "grad_norm": 0.7218056321144104, + "learning_rate": 0.0002142009537679292, + "loss": 0.42701358795166017, + "mean_token_accuracy": 0.8695114746689796, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5202612736543943, + "eval_loss": 0.5491839051246643, + "eval_mean_token_accuracy": 0.8494071208460386, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.1142, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 940 + }, + { + "entropy": 0.4762951169162989, + "epoch": 2.3885429638854294, + "grad_norm": 0.7194424867630005, + "learning_rate": 0.0002133024174675534, + "loss": 0.42299847602844237, + "mean_token_accuracy": 0.8709790132939815, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4899340462546016, + "eval_loss": 0.5522511601448059, + "eval_mean_token_accuracy": 0.8492208258357159, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.463, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 960 + }, + { + "entropy": 0.49650347977876663, + "epoch": 2.4383561643835616, + "grad_norm": 0.8406022787094116, + "learning_rate": 0.0002123736734663221, + "loss": 0.4275330066680908, + "mean_token_accuracy": 0.8670595556497573, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.49691385654515996, + "eval_loss": 0.5491269826889038, + "eval_mean_token_accuracy": 0.850309816210769, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.17, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 980 + }, + { + "entropy": 0.48843890577554705, + "epoch": 2.488169364881694, + "grad_norm": 0.9082473516464233, + "learning_rate": 0.00021141500186075868, + "loss": 0.4309722423553467, + "mean_token_accuracy": 0.8686766296625137, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5543508351195691, + "eval_loss": 0.5478800535202026, + "eval_mean_token_accuracy": 0.8478029522784921, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.3835, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 1000 + }, + { + "entropy": 0.4777219031006098, + "epoch": 2.5379825653798256, + "grad_norm": 0.7448089122772217, + "learning_rate": 0.0002104266917731438, + "loss": 0.423325252532959, + "mean_token_accuracy": 0.8706337086856365, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.49857561550168106, + "eval_loss": 0.5511948466300964, + "eval_mean_token_accuracy": 0.8502220289651737, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.5399, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.988, + "step": 1020 + }, + { + "entropy": 0.4844174191355705, + "epoch": 2.587795765877958, + "grad_norm": 0.794029176235199, + "learning_rate": 0.00020940904126432, + "loss": 0.4176753044128418, + "mean_token_accuracy": 0.873535567522049, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.485467542222766, + "eval_loss": 0.5539286732673645, + "eval_mean_token_accuracy": 0.8495475081510322, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.135, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 1.997, + "step": 1040 + }, + { + "entropy": 0.49070929251611234, + "epoch": 2.6376089663760895, + "grad_norm": 0.7558256983757019, + "learning_rate": 0.0002083623572438007, + "loss": 0.42867293357849123, + "mean_token_accuracy": 0.8696666076779366, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.490822730889154, + "eval_loss": 0.5434785485267639, + "eval_mean_token_accuracy": 0.850568296950917, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.4933, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 1060 + }, + { + "entropy": 0.47806114703416824, + "epoch": 2.6874221668742218, + "grad_norm": 0.6608979105949402, + "learning_rate": 0.00020728695537721047, + "loss": 0.4289727687835693, + "mean_token_accuracy": 0.8693130135536193, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.5285773256490397, + "eval_loss": 0.5444230437278748, + "eval_mean_token_accuracy": 0.8498796481032704, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.7091, + "eval_samples_per_second": 15.858, + "eval_steps_per_second": 1.984, + "step": 1080 + }, + { + "entropy": 0.5046216730028391, + "epoch": 2.7372353673723535, + "grad_norm": 0.8428544998168945, + "learning_rate": 0.00020618315999108454, + "loss": 0.43131070137023925, + "mean_token_accuracy": 0.8701941035687923, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.49888394738352576, + "eval_loss": 0.5459766387939453, + "eval_mean_token_accuracy": 0.8511758872935938, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.2222, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.995, + "step": 1100 + }, + { + "entropy": 0.5212558470666409, + "epoch": 2.7870485678704857, + "grad_norm": 1.129318118095398, + "learning_rate": 0.00020505130397505635, + "loss": 0.44249300956726073, + "mean_token_accuracy": 0.8654101334512234, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5179622324053631, + "eval_loss": 0.5522801280021667, + "eval_mean_token_accuracy": 0.8497019947268242, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.1903, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.996, + "step": 1120 + }, + { + "entropy": 0.4988406613469124, + "epoch": 2.8368617683686175, + "grad_norm": 0.6460545063018799, + "learning_rate": 0.00020389172868146263, + "loss": 0.4386270523071289, + "mean_token_accuracy": 0.8690383620560169, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.5042278484203094, + "eval_loss": 0.5433034300804138, + "eval_mean_token_accuracy": 0.8497674451317898, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.3028, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.993, + "step": 1140 + }, + { + "entropy": 0.4926559619605541, + "epoch": 2.8866749688667497, + "grad_norm": 0.8199329972267151, + "learning_rate": 0.00020270478382239615, + "loss": 0.4313485145568848, + "mean_token_accuracy": 0.8674727231264114, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.503873193160046, + "eval_loss": 0.5388111472129822, + "eval_mean_token_accuracy": 0.8526195034731266, + "eval_num_tokens": 2710196.0, + "eval_runtime": 86.4054, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.991, + "step": 1160 + }, + { + "entropy": 0.5020013231784105, + "epoch": 2.936488169364882, + "grad_norm": 0.7344821095466614, + "learning_rate": 0.00020149082736423723, + "loss": 0.43590536117553713, + "mean_token_accuracy": 0.8671772189438343, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5368241809828337, + "eval_loss": 0.5355703830718994, + "eval_mean_token_accuracy": 0.8517617773871089, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.2945, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1180 + }, + { + "entropy": 0.5112275708466768, + "epoch": 2.9863013698630136, + "grad_norm": 0.6951606869697571, + "learning_rate": 0.00020025022541969622, + "loss": 0.43579301834106443, + "mean_token_accuracy": 0.8641206480562686, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.5066795706055885, + "eval_loss": 0.5415249466896057, + "eval_mean_token_accuracy": 0.8493563373421513, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.5005, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.988, + "step": 1200 + }, + { + "entropy": 0.42298635305502474, + "epoch": 3.0348692403486925, + "grad_norm": 0.8201794028282166, + "learning_rate": 0.00019898335213739863, + "loss": 0.35593905448913576, + "mean_token_accuracy": 0.889238600547497, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.4584170470750609, + "eval_loss": 0.569487452507019, + "eval_mean_token_accuracy": 0.8495814173027526, + "eval_num_tokens": 2848509.0, + "eval_runtime": 86.2281, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 1220 + }, + { + "entropy": 0.37450140453875064, + "epoch": 3.0846824408468243, + "grad_norm": 0.7308394908905029, + "learning_rate": 0.0001976905895890471, + "loss": 0.307823920249939, + "mean_token_accuracy": 0.9001288741827012, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.45185995916294497, + "eval_loss": 0.5672881603240967, + "eval_mean_token_accuracy": 0.8511318519364955, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.0819, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.998, + "step": 1240 + }, + { + "entropy": 0.3887945845723152, + "epoch": 3.1344956413449565, + "grad_norm": 0.7299330830574036, + "learning_rate": 0.0001963723276541939, + "loss": 0.32047903537750244, + "mean_token_accuracy": 0.8960984498262405, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.44865354549053105, + "eval_loss": 0.5666037201881409, + "eval_mean_token_accuracy": 0.8496572649063066, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 1260 + }, + { + "entropy": 0.39677664265036583, + "epoch": 3.1843088418430883, + "grad_norm": 0.9533219933509827, + "learning_rate": 0.00019502896390265838, + "loss": 0.3253983497619629, + "mean_token_accuracy": 0.8964207418262958, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.4641980809527774, + "eval_loss": 0.5814996957778931, + "eval_mean_token_accuracy": 0.8485886212005171, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.7784, + "eval_samples_per_second": 15.845, + "eval_steps_per_second": 1.982, + "step": 1280 + }, + { + "entropy": 0.39210722744464876, + "epoch": 3.2341220423412205, + "grad_norm": 0.7447651028633118, + "learning_rate": 0.00019366090347462545, + "loss": 0.3276803970336914, + "mean_token_accuracy": 0.8930055953562259, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43595615254585135, + "eval_loss": 0.5722188353538513, + "eval_mean_token_accuracy": 0.8501105755567551, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.5271, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 1300 + }, + { + "entropy": 0.3684127271175385, + "epoch": 3.2839352428393527, + "grad_norm": 0.6934201121330261, + "learning_rate": 0.00019226855895846078, + "loss": 0.3156379222869873, + "mean_token_accuracy": 0.8976306475698947, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.4628148723480313, + "eval_loss": 0.5631352066993713, + "eval_mean_token_accuracy": 0.8504934813394103, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.3436, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 1320 + }, + { + "entropy": 0.4073401909321547, + "epoch": 3.3337484433374844, + "grad_norm": 0.9386897683143616, + "learning_rate": 0.00019085235026627994, + "loss": 0.34265310764312745, + "mean_token_accuracy": 0.8902062118053437, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.46455050623694133, + "eval_loss": 0.5586736798286438, + "eval_mean_token_accuracy": 0.8506874702004499, + "eval_num_tokens": 3132874.0, + "eval_runtime": 86.1286, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.997, + "step": 1340 + }, + { + "entropy": 0.4046429242938757, + "epoch": 3.383561643835616, + "grad_norm": 0.9633992314338684, + "learning_rate": 0.00018941270450730836, + "loss": 0.33816893100738527, + "mean_token_accuracy": 0.8927541889250279, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.46846531660750856, + "eval_loss": 0.561501681804657, + "eval_mean_token_accuracy": 0.8496256377114806, + "eval_num_tokens": 3178055.0, + "eval_runtime": 86.685, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1360 + }, + { + "entropy": 0.39872407019138334, + "epoch": 3.4333748443337484, + "grad_norm": 0.7786458730697632, + "learning_rate": 0.00018795005585907113, + "loss": 0.33342490196228025, + "mean_token_accuracy": 0.8944805048406124, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.42709505973860273, + "eval_loss": 0.5751848220825195, + "eval_mean_token_accuracy": 0.8507290447867194, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.6892, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 1380 + }, + { + "entropy": 0.3923338124528527, + "epoch": 3.4831880448318806, + "grad_norm": 0.9305956363677979, + "learning_rate": 0.0001864648454364511, + "loss": 0.33188116550445557, + "mean_token_accuracy": 0.8943330392241478, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.4386174779298694, + "eval_loss": 0.5680831074714661, + "eval_mean_token_accuracy": 0.8513129727784977, + "eval_num_tokens": 3274096.0, + "eval_runtime": 86.2671, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 1400 + }, + { + "entropy": 0.3856233984231949, + "epoch": 3.5330012453300124, + "grad_norm": 1.0362752676010132, + "learning_rate": 0.0001849575211586545, + "loss": 0.33098697662353516, + "mean_token_accuracy": 0.8961390435695649, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4574795474493226, + "eval_loss": 0.5630439519882202, + "eval_mean_token_accuracy": 0.8520988873964133, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.6035, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 1420 + }, + { + "entropy": 0.39812871962785723, + "epoch": 3.5828144458281446, + "grad_norm": 0.7807195782661438, + "learning_rate": 0.0001834285376141247, + "loss": 0.3333771228790283, + "mean_token_accuracy": 0.8930827379226685, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.4556825893909432, + "eval_loss": 0.5689062476158142, + "eval_mean_token_accuracy": 0.8507103507601937, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.1606, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.996, + "step": 1440 + }, + { + "entropy": 0.4147744856774807, + "epoch": 3.6326276463262763, + "grad_norm": 0.6429352164268494, + "learning_rate": 0.00018187835592344443, + "loss": 0.3482560873031616, + "mean_token_accuracy": 0.8910200245678425, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.46600024540757023, + "eval_loss": 0.5609709024429321, + "eval_mean_token_accuracy": 0.8491220876227977, + "eval_num_tokens": 3415600.0, + "eval_runtime": 86.8039, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1460 + }, + { + "entropy": 0.40425071083009245, + "epoch": 3.6824408468244085, + "grad_norm": 0.8613698482513428, + "learning_rate": 0.0001803074436002682, + "loss": 0.342916464805603, + "mean_token_accuracy": 0.8916418336331844, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.43855057899342026, + "eval_loss": 0.5720968246459961, + "eval_mean_token_accuracy": 0.8500823641932288, + "eval_num_tokens": 3460471.0, + "eval_runtime": 86.6746, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1480 + }, + { + "entropy": 0.39465143866837027, + "epoch": 3.7322540473225407, + "grad_norm": 0.6285189986228943, + "learning_rate": 0.0001787162744103265, + "loss": 0.3424591779708862, + "mean_token_accuracy": 0.8906558901071548, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4509461877304454, + "eval_loss": 0.5590082406997681, + "eval_mean_token_accuracy": 0.8511747371318729, + "eval_num_tokens": 3507647.0, + "eval_runtime": 86.8126, + "eval_samples_per_second": 15.839, + "eval_steps_per_second": 1.981, + "step": 1500 + }, + { + "entropy": 0.4021005939692259, + "epoch": 3.7820672478206725, + "grad_norm": 0.8821248412132263, + "learning_rate": 0.00017710532822854468, + "loss": 0.3462103843688965, + "mean_token_accuracy": 0.889109355956316, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.4502199075596277, + "eval_loss": 0.566046416759491, + "eval_mean_token_accuracy": 0.8501714208098345, + "eval_num_tokens": 3548934.0, + "eval_runtime": 86.8336, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.981, + "step": 1520 + }, + { + "entropy": 0.4017397932708263, + "epoch": 3.8318804483188043, + "grad_norm": 0.8400952816009521, + "learning_rate": 0.0001754750908943189, + "loss": 0.34890995025634763, + "mean_token_accuracy": 0.8892098367214203, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.4614003023435903, + "eval_loss": 0.5617933869361877, + "eval_mean_token_accuracy": 0.8515863616106122, + "eval_num_tokens": 3597186.0, + "eval_runtime": 86.4609, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 1540 + }, + { + "entropy": 0.4112051840871572, + "epoch": 3.8816936488169365, + "grad_norm": 0.769478440284729, + "learning_rate": 0.0001738260540649939, + "loss": 0.34711437225341796, + "mean_token_accuracy": 0.8911717928946018, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4540443811998811, + "eval_loss": 0.5576469898223877, + "eval_mean_token_accuracy": 0.8512079674144124, + "eval_num_tokens": 3646646.0, + "eval_runtime": 86.5103, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 1560 + }, + { + "entropy": 0.41105241514742374, + "epoch": 3.9315068493150687, + "grad_norm": 0.8468427062034607, + "learning_rate": 0.00017215871506758568, + "loss": 0.3433023452758789, + "mean_token_accuracy": 0.8898739732801915, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.4707539707075718, + "eval_loss": 0.5641466379165649, + "eval_mean_token_accuracy": 0.8495440957851188, + "eval_num_tokens": 3689560.0, + "eval_runtime": 86.609, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.986, + "step": 1580 + }, + { + "entropy": 0.41016379147768023, + "epoch": 3.9813200498132004, + "grad_norm": 0.7482675313949585, + "learning_rate": 0.0001704735767487946, + "loss": 0.34550890922546384, + "mean_token_accuracy": 0.8893028847873211, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.46391099864660307, + "eval_loss": 0.5593640804290771, + "eval_mean_token_accuracy": 0.8510130581467651, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.3975, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 1600 + }, + { + "entropy": 0.33167599791135544, + "epoch": 4.029887920298879, + "grad_norm": 0.9435692429542542, + "learning_rate": 0.00016877114732335337, + "loss": 0.2716026544570923, + "mean_token_accuracy": 0.9133149828666296, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.38499350005457567, + "eval_loss": 0.6298249363899231, + "eval_mean_token_accuracy": 0.8488117071778275, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.2933, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1620 + }, + { + "entropy": 0.3000166634097695, + "epoch": 4.0797011207970115, + "grad_norm": 0.8080845475196838, + "learning_rate": 0.0001670519402207569, + "loss": 0.22617182731628419, + "mean_token_accuracy": 0.9253474645316601, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.370110988703578, + "eval_loss": 0.6338461637496948, + "eval_mean_token_accuracy": 0.8485634801692741, + "eval_num_tokens": 3828830.0, + "eval_runtime": 85.9508, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.001, + "step": 1640 + }, + { + "entropy": 0.2986910421401262, + "epoch": 4.129514321295143, + "grad_norm": 0.7310900092124939, + "learning_rate": 0.0001653164739304185, + "loss": 0.22367463111877442, + "mean_token_accuracy": 0.9252275295555592, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.3944379702037157, + "eval_loss": 0.6109381914138794, + "eval_mean_token_accuracy": 0.849291454220927, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.6728, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1660 + }, + { + "entropy": 0.3095553796738386, + "epoch": 4.179327521793275, + "grad_norm": 0.7059140801429749, + "learning_rate": 0.0001635652718453007, + "loss": 0.23651680946350098, + "mean_token_accuracy": 0.9208931416273117, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.3910588648949945, + "eval_loss": 0.6104469299316406, + "eval_mean_token_accuracy": 0.8486883893262508, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7612, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.982, + "step": 1680 + }, + { + "entropy": 0.3001101028174162, + "epoch": 4.229140722291407, + "grad_norm": 0.6787802577018738, + "learning_rate": 0.00016179886210406728, + "loss": 0.23130471706390382, + "mean_token_accuracy": 0.9233332790434361, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3794369170832079, + "eval_loss": 0.6182110905647278, + "eval_mean_token_accuracy": 0.8495433777570724, + "eval_num_tokens": 3967474.0, + "eval_runtime": 85.94, + "eval_samples_per_second": 16.0, + "eval_steps_per_second": 2.001, + "step": 1700 + }, + { + "entropy": 0.3031421799212694, + "epoch": 4.2789539227895395, + "grad_norm": 0.9732038378715515, + "learning_rate": 0.0001600177774318036, + "loss": 0.2359529733657837, + "mean_token_accuracy": 0.9217648565769195, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3923123094231583, + "eval_loss": 0.6057384610176086, + "eval_mean_token_accuracy": 0.8508818288182103, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7647, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.29365369994193313, + "epoch": 4.328767123287671, + "grad_norm": 0.7681498527526855, + "learning_rate": 0.0001582225549793541, + "loss": 0.2269371747970581, + "mean_token_accuracy": 0.9245341829955578, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.4011661055129628, + "eval_loss": 0.6144486665725708, + "eval_mean_token_accuracy": 0.8480324357054955, + "eval_num_tokens": 4062594.0, + "eval_runtime": 87.1306, + "eval_samples_per_second": 15.781, + "eval_steps_per_second": 1.974, + "step": 1740 + }, + { + "entropy": 0.29396994728595016, + "epoch": 4.378580323785803, + "grad_norm": 1.0001007318496704, + "learning_rate": 0.0001564137361613248, + "loss": 0.22777395248413085, + "mean_token_accuracy": 0.9262309700250626, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38518730195802314, + "eval_loss": 0.6202630400657654, + "eval_mean_token_accuracy": 0.8493869807137999, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6616, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.3096018506214023, + "epoch": 4.428393524283935, + "grad_norm": 1.0448365211486816, + "learning_rate": 0.00015459186649280024, + "loss": 0.23696351051330566, + "mean_token_accuracy": 0.9217322513461113, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.3946371126140273, + "eval_loss": 0.6079026460647583, + "eval_mean_token_accuracy": 0.8492515852978063, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6582, + "eval_samples_per_second": 15.867, + "eval_steps_per_second": 1.985, + "step": 1780 + }, + { + "entropy": 0.32619857545942066, + "epoch": 4.478206724782067, + "grad_norm": 0.7210651636123657, + "learning_rate": 0.00015275749542482337, + "loss": 0.24651215076446534, + "mean_token_accuracy": 0.9177676141262054, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.3947690814560236, + "eval_loss": 0.6065912246704102, + "eval_mean_token_accuracy": 0.8502957744653835, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.5959, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.986, + "step": 1800 + }, + { + "entropy": 0.3193941755220294, + "epoch": 4.5280199252802, + "grad_norm": 0.8281906843185425, + "learning_rate": 0.0001509111761786888, + "loss": 0.23936262130737304, + "mean_token_accuracy": 0.9201708927750587, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38704028864239537, + "eval_loss": 0.6006569266319275, + "eval_mean_token_accuracy": 0.8502406720505205, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.8059, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1820 + }, + { + "entropy": 0.3164879363030195, + "epoch": 4.577833125778331, + "grad_norm": 0.7892968654632568, + "learning_rate": 0.00014905346557909867, + "loss": 0.24541733264923096, + "mean_token_accuracy": 0.9175932116806507, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.38861122120951497, + "eval_loss": 0.6115967631340027, + "eval_mean_token_accuracy": 0.849471275196519, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.2946, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1840 + }, + { + "entropy": 0.3051785985007882, + "epoch": 4.627646326276463, + "grad_norm": 0.8109654188156128, + "learning_rate": 0.0001471849238862319, + "loss": 0.23433220386505127, + "mean_token_accuracy": 0.9206570319831371, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.37162452295076015, + "eval_loss": 0.6184061765670776, + "eval_mean_token_accuracy": 0.8501173268223918, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.6865, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1860 + }, + { + "entropy": 0.3168198253959417, + "epoch": 4.677459526774595, + "grad_norm": 0.9512342214584351, + "learning_rate": 0.0001453061146267775, + "loss": 0.23832404613494873, + "mean_token_accuracy": 0.9197044663131237, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3845940856912801, + "eval_loss": 0.606762707233429, + "eval_mean_token_accuracy": 0.8504838194957999, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.5175, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 1880 + }, + { + "entropy": 0.30791807882487776, + "epoch": 4.7272727272727275, + "grad_norm": 0.8123113512992859, + "learning_rate": 0.00014341760442398248, + "loss": 0.2395785331726074, + "mean_token_accuracy": 0.918928150832653, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.39762327222283494, + "eval_loss": 0.5994202494621277, + "eval_mean_token_accuracy": 0.8509274201337681, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.2873, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.993, + "step": 1900 + }, + { + "entropy": 0.3021434534341097, + "epoch": 4.777085927770859, + "grad_norm": 0.731787383556366, + "learning_rate": 0.000141519962826766, + "loss": 0.23494718074798585, + "mean_token_accuracy": 0.9201403826475143, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.3827026732439219, + "eval_loss": 0.5995895862579346, + "eval_mean_token_accuracy": 0.851468373523202, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.3006, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 1920 + }, + { + "entropy": 0.31626159623265265, + "epoch": 4.826899128268991, + "grad_norm": 0.8848487138748169, + "learning_rate": 0.00013961376213795132, + "loss": 0.2439030647277832, + "mean_token_accuracy": 0.9196575872600079, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.388698436839636, + "eval_loss": 0.6000174283981323, + "eval_mean_token_accuracy": 0.8518068187458571, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.8979, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.979, + "step": 1940 + }, + { + "entropy": 0.30520407035946845, + "epoch": 4.876712328767123, + "grad_norm": 0.8532460927963257, + "learning_rate": 0.00013769957724166695, + "loss": 0.23458616733551024, + "mean_token_accuracy": 0.9221912942826748, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.38777847102908203, + "eval_loss": 0.6004981398582458, + "eval_mean_token_accuracy": 0.8516481768253238, + "eval_num_tokens": 4578167.0, + "eval_runtime": 87.0777, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.975, + "step": 1960 + }, + { + "entropy": 0.3226448342204094, + "epoch": 4.926525529265255, + "grad_norm": 0.6945561766624451, + "learning_rate": 0.0001357779854299694, + "loss": 0.24048397541046143, + "mean_token_accuracy": 0.9195300146937371, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.38581624263247777, + "eval_loss": 0.6029234528541565, + "eval_mean_token_accuracy": 0.8514213260523108, + "eval_num_tokens": 4622316.0, + "eval_runtime": 85.8729, + "eval_samples_per_second": 16.012, + "eval_steps_per_second": 2.003, + "step": 1980 + }, + { + "entropy": 0.3051655298098922, + "epoch": 4.976338729763388, + "grad_norm": 0.7976452708244324, + "learning_rate": 0.00013384956622874001, + "loss": 0.23584742546081544, + "mean_token_accuracy": 0.9216851457953453, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.37913159246361533, + "eval_loss": 0.6057604551315308, + "eval_mean_token_accuracy": 0.8525801203971686, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.1145, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 2000 + }, + { + "entropy": 0.27438195240803254, + "epoch": 5.024906600249066, + "grad_norm": 0.6729586124420166, + "learning_rate": 0.0001319149012229075, + "loss": 0.19775952100753785, + "mean_token_accuracy": 0.9339428559327737, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.3448961910813354, + "eval_loss": 0.6750120520591736, + "eval_mean_token_accuracy": 0.8487970232963562, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.1169, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 2020 + }, + { + "entropy": 0.21423916313797237, + "epoch": 5.074719800747198, + "grad_norm": 0.6934391856193542, + "learning_rate": 0.00012997457388105022, + "loss": 0.1439570426940918, + "mean_token_accuracy": 0.9528236843645572, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.3570949243771475, + "eval_loss": 0.6465504169464111, + "eval_mean_token_accuracy": 0.8490785547467166, + "eval_num_tokens": 4763269.0, + "eval_runtime": 85.9574, + "eval_samples_per_second": 15.996, + "eval_steps_per_second": 2.001, + "step": 2040 + }, + { + "entropy": 0.20838565267622472, + "epoch": 5.12453300124533, + "grad_norm": 0.7286986112594604, + "learning_rate": 0.00012802916937942972, + "loss": 0.14467307329177856, + "mean_token_accuracy": 0.950994835793972, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.3452463157821533, + "eval_loss": 0.6705958843231201, + "eval_mean_token_accuracy": 0.8490352796953778, + "eval_num_tokens": 4809047.0, + "eval_runtime": 86.228, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 2060 + }, + { + "entropy": 0.20453082229942082, + "epoch": 5.174346201743462, + "grad_norm": 0.7515555620193481, + "learning_rate": 0.00012607927442550974, + "loss": 0.13732000589370727, + "mean_token_accuracy": 0.9537357829511166, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.32431264914745506, + "eval_loss": 0.6743043065071106, + "eval_mean_token_accuracy": 0.8504878629085629, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.5948, + "eval_samples_per_second": 15.879, + "eval_steps_per_second": 1.986, + "step": 2080 + }, + { + "entropy": 0.21812320686876774, + "epoch": 5.224159402241594, + "grad_norm": 0.9093465209007263, + "learning_rate": 0.0001241254770810132, + "loss": 0.14311420917510986, + "mean_token_accuracy": 0.9514068141579628, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.33086285835435225, + "eval_loss": 0.6676449179649353, + "eval_mean_token_accuracy": 0.8505287662495015, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 2100 + }, + { + "entropy": 0.2180163251236081, + "epoch": 5.273972602739726, + "grad_norm": 0.6703007221221924, + "learning_rate": 0.00012216836658457075, + "loss": 0.14803968667984008, + "mean_token_accuracy": 0.9521303348243236, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.33162341708707255, + "eval_loss": 0.6658875942230225, + "eval_mean_token_accuracy": 0.8500757605530495, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.6296, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 2120 + }, + { + "entropy": 0.22511130161583423, + "epoch": 5.323785803237858, + "grad_norm": 0.8078880906105042, + "learning_rate": 0.00012020853317401455, + "loss": 0.15228408575057983, + "mean_token_accuracy": 0.947144789993763, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3354601170434508, + "eval_loss": 0.6677829623222351, + "eval_mean_token_accuracy": 0.8482600024273229, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.4689, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.989, + "step": 2140 + }, + { + "entropy": 0.2244176059961319, + "epoch": 5.37359900373599, + "grad_norm": 0.9636075496673584, + "learning_rate": 0.00011824656790837037, + "loss": 0.15260883569717407, + "mean_token_accuracy": 0.9471467643976211, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.3381616926297199, + "eval_loss": 0.6694412231445312, + "eval_mean_token_accuracy": 0.8482369603805764, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.4147, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 2160 + }, + { + "entropy": 0.22982364390045404, + "epoch": 5.423412204234122, + "grad_norm": 0.775401771068573, + "learning_rate": 0.00011628306248960262, + "loss": 0.15140302181243898, + "mean_token_accuracy": 0.9492553934454918, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.3305150235808173, + "eval_loss": 0.6717822551727295, + "eval_mean_token_accuracy": 0.8489849723355715, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.4728, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.989, + "step": 2180 + }, + { + "entropy": 0.21448935717344284, + "epoch": 5.473225404732254, + "grad_norm": 0.6575281023979187, + "learning_rate": 0.00011431860908416465, + "loss": 0.1452319622039795, + "mean_token_accuracy": 0.9505287684500218, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3488145174328671, + "eval_loss": 0.6612305641174316, + "eval_mean_token_accuracy": 0.8492907808963642, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6927, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 2200 + }, + { + "entropy": 0.23091202937066554, + "epoch": 5.523038605230386, + "grad_norm": 0.8909686207771301, + "learning_rate": 0.00011235380014440985, + "loss": 0.15150139331817628, + "mean_token_accuracy": 0.9497875183820724, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.3268539015810157, + "eval_loss": 0.6667542457580566, + "eval_mean_token_accuracy": 0.8499062903398691, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.4644, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 2220 + }, + { + "entropy": 0.2227974807843566, + "epoch": 5.572851805728518, + "grad_norm": 0.6180275082588196, + "learning_rate": 0.0001103892282299158, + "loss": 0.1491069197654724, + "mean_token_accuracy": 0.9488144010305405, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3346347655494546, + "eval_loss": 0.6665948629379272, + "eval_mean_token_accuracy": 0.8499961893918903, + "eval_num_tokens": 5226864.0, + "eval_runtime": 87.0548, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.976, + "step": 2240 + }, + { + "entropy": 0.21368421968072654, + "epoch": 5.62266500622665, + "grad_norm": 0.6004369258880615, + "learning_rate": 0.00010842548582877651, + "loss": 0.14485255479812623, + "mean_token_accuracy": 0.9502056457102299, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.32753298804163933, + "eval_loss": 0.6680151224136353, + "eval_mean_token_accuracy": 0.8515451086121936, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.8524, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.98, + "step": 2260 + }, + { + "entropy": 0.2103635374456644, + "epoch": 5.672478206724782, + "grad_norm": 0.699174702167511, + "learning_rate": 0.00010646316517891613, + "loss": 0.14297772645950318, + "mean_token_accuracy": 0.9512537539005279, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.32966585959806, + "eval_loss": 0.675578773021698, + "eval_mean_token_accuracy": 0.8509623023659684, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.4518, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.99, + "step": 2280 + }, + { + "entropy": 0.22516900151968003, + "epoch": 5.722291407222914, + "grad_norm": 0.6637354493141174, + "learning_rate": 0.00010450285808947797, + "loss": 0.15202572345733642, + "mean_token_accuracy": 0.9482452072203159, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3369456917740578, + "eval_loss": 0.6697061061859131, + "eval_mean_token_accuracy": 0.848603522361711, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.6371, + "eval_samples_per_second": 15.871, + "eval_steps_per_second": 1.985, + "step": 2300 + }, + { + "entropy": 0.21841065725311637, + "epoch": 5.772104607721046, + "grad_norm": 0.7940268516540527, + "learning_rate": 0.00010254515576234297, + "loss": 0.14710167646408082, + "mean_token_accuracy": 0.9493498183786869, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3237486180177955, + "eval_loss": 0.6779657602310181, + "eval_mean_token_accuracy": 0.8500715313955794, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.1826, + "eval_samples_per_second": 15.954, + "eval_steps_per_second": 1.996, + "step": 2320 + }, + { + "entropy": 0.22146204356104135, + "epoch": 5.821917808219178, + "grad_norm": 0.9234833121299744, + "learning_rate": 0.00010059064861383132, + "loss": 0.14720046520233154, + "mean_token_accuracy": 0.9493872679769992, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.32365207564692167, + "eval_loss": 0.6704005002975464, + "eval_mean_token_accuracy": 0.8507985760306203, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.5494, + "eval_samples_per_second": 15.887, + "eval_steps_per_second": 1.987, + "step": 2340 + }, + { + "entropy": 0.20934011954814197, + "epoch": 5.87173100871731, + "grad_norm": 0.5547503232955933, + "learning_rate": 9.863992609664084e-05, + "loss": 0.1464867353439331, + "mean_token_accuracy": 0.9503875687718392, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.3330401429083458, + "eval_loss": 0.6659091114997864, + "eval_mean_token_accuracy": 0.8504848906467127, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.5855, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 2360 + }, + { + "entropy": 0.21678635366261007, + "epoch": 5.921544209215442, + "grad_norm": 0.570612907409668, + "learning_rate": 9.669357652207635e-05, + "loss": 0.14821385145187377, + "mean_token_accuracy": 0.9503940217196941, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3322022325077722, + "eval_loss": 0.6722489595413208, + "eval_mean_token_accuracy": 0.8489979422369669, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.2986, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 2380 + }, + { + "entropy": 0.20932920072227718, + "epoch": 5.971357409713574, + "grad_norm": 0.7879557609558105, + "learning_rate": 9.475218688262262e-05, + "loss": 0.14675841331481934, + "mean_token_accuracy": 0.9507176131010056, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.3199348642902319, + "eval_loss": 0.6698136329650879, + "eval_mean_token_accuracy": 0.8514142130003419, + "eval_num_tokens": 5605400.0, + "eval_runtime": 85.8995, + "eval_samples_per_second": 16.007, + "eval_steps_per_second": 2.002, + "step": 2400 + }, + { + "entropy": 0.21032143919131693, + "epoch": 6.019925280199253, + "grad_norm": 0.5823076367378235, + "learning_rate": 9.281634267491569e-05, + "loss": 0.13322267532348633, + "mean_token_accuracy": 0.9550939072401096, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.30206270117399303, + "eval_loss": 0.7093168497085571, + "eval_mean_token_accuracy": 0.8500627639681794, + "eval_num_tokens": 5648968.0, + "eval_runtime": 85.8128, + "eval_samples_per_second": 16.023, + "eval_steps_per_second": 2.004, + "step": 2420 + }, + { + "entropy": 0.1534628233872354, + "epoch": 6.069738480697385, + "grad_norm": 0.710133969783783, + "learning_rate": 9.088662772316508e-05, + "loss": 0.09078952670097351, + "mean_token_accuracy": 0.9678447999060154, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.28208133101809857, + "eval_loss": 0.7636417150497437, + "eval_mean_token_accuracy": 0.8494061477655588, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9724, + "eval_samples_per_second": 15.994, + "eval_steps_per_second": 2.001, + "step": 2440 + }, + { + "entropy": 0.16151462448760867, + "epoch": 6.119551681195516, + "grad_norm": 0.5793812274932861, + "learning_rate": 8.896362400308028e-05, + "loss": 0.09545697569847107, + "mean_token_accuracy": 0.9671573750674725, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.2833245605403601, + "eval_loss": 0.7402405738830566, + "eval_mean_token_accuracy": 0.8503523728875226, + "eval_num_tokens": 5745090.0, + "eval_runtime": 85.5461, + "eval_samples_per_second": 16.073, + "eval_steps_per_second": 2.011, + "step": 2460 + }, + { + "entropy": 0.15203177919611335, + "epoch": 6.169364881693649, + "grad_norm": 0.4251123368740082, + "learning_rate": 8.704791146635483e-05, + "loss": 0.09420782327651978, + "mean_token_accuracy": 0.9677386932075024, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.28572545962971313, + "eval_loss": 0.735416829586029, + "eval_mean_token_accuracy": 0.8487084663884584, + "eval_num_tokens": 5790333.0, + "eval_runtime": 85.4801, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.012, + "step": 2480 + }, + { + "entropy": 0.15587336672469973, + "epoch": 6.219178082191781, + "grad_norm": 0.4357028007507324, + "learning_rate": 8.514006786576085e-05, + "loss": 0.09429320096969604, + "mean_token_accuracy": 0.9682952925562859, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.2859006894882335, + "eval_loss": 0.7347224950790405, + "eval_mean_token_accuracy": 0.8501905518215757, + "eval_num_tokens": 5837321.0, + "eval_runtime": 85.7578, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.006, + "step": 2500 + }, + { + "entropy": 0.15765639198943973, + "epoch": 6.268991282689913, + "grad_norm": 0.47331130504608154, + "learning_rate": 8.324066858090663e-05, + "loss": 0.09571113586425781, + "mean_token_accuracy": 0.9683481335639954, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.29231513846059176, + "eval_loss": 0.7392512559890747, + "eval_mean_token_accuracy": 0.8486633983462356, + "eval_num_tokens": 5884398.0, + "eval_runtime": 85.7846, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.005, + "step": 2520 + }, + { + "entropy": 0.16176860257983208, + "epoch": 6.318804483188045, + "grad_norm": 0.6142018437385559, + "learning_rate": 8.135028644470992e-05, + "loss": 0.09486144185066223, + "mean_token_accuracy": 0.9682316601276397, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.2851274753379267, + "eval_loss": 0.7520816922187805, + "eval_mean_token_accuracy": 0.8501113649717597, + "eval_num_tokens": 5929876.0, + "eval_runtime": 85.9425, + "eval_samples_per_second": 15.999, + "eval_steps_per_second": 2.001, + "step": 2540 + }, + { + "entropy": 0.15404034564271568, + "epoch": 6.3686176836861765, + "grad_norm": 0.6051287651062012, + "learning_rate": 7.946949157063964e-05, + "loss": 0.09280472993850708, + "mean_token_accuracy": 0.9684635892510414, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28802703563557114, + "eval_loss": 0.7439162135124207, + "eval_mean_token_accuracy": 0.8499851770872293, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.0703, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.998, + "step": 2560 + }, + { + "entropy": 0.15343588953837753, + "epoch": 6.418430884184309, + "grad_norm": 0.4823743402957916, + "learning_rate": 7.759885118077701e-05, + "loss": 0.09000591039657593, + "mean_token_accuracy": 0.9699928767979145, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2795634938533916, + "eval_loss": 0.7647850513458252, + "eval_mean_token_accuracy": 0.8503464397995971, + "eval_num_tokens": 6025380.0, + "eval_runtime": 85.8886, + "eval_samples_per_second": 16.009, + "eval_steps_per_second": 2.003, + "step": 2580 + }, + { + "entropy": 0.15740026142448188, + "epoch": 6.468244084682441, + "grad_norm": 0.5082696676254272, + "learning_rate": 7.57389294347494e-05, + "loss": 0.09191849827766418, + "mean_token_accuracy": 0.9692809768021107, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2913342311458532, + "eval_loss": 0.7518694996833801, + "eval_mean_token_accuracy": 0.8483168302580367, + "eval_num_tokens": 6073349.0, + "eval_runtime": 85.5761, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.01, + "step": 2600 + }, + { + "entropy": 0.15922069251537324, + "epoch": 6.518057285180573, + "grad_norm": 0.3995199501514435, + "learning_rate": 7.389028725958736e-05, + "loss": 0.09584367871284485, + "mean_token_accuracy": 0.9685114495456218, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.2863075934177221, + "eval_loss": 0.7539381384849548, + "eval_mean_token_accuracy": 0.8507507083027862, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.112, + "eval_samples_per_second": 15.968, + "eval_steps_per_second": 1.997, + "step": 2620 + }, + { + "entropy": 0.16197575423866512, + "epoch": 6.567870485678705, + "grad_norm": 0.534295380115509, + "learning_rate": 7.205348218055678e-05, + "loss": 0.0961170256137848, + "mean_token_accuracy": 0.9674530044198036, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.29021967315050057, + "eval_loss": 0.751198947429657, + "eval_mean_token_accuracy": 0.8509796344956686, + "eval_num_tokens": 6165523.0, + "eval_runtime": 85.7958, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.005, + "step": 2640 + }, + { + "entropy": 0.15261746793985367, + "epoch": 6.617683686176837, + "grad_norm": 0.5391237139701843, + "learning_rate": 7.022906815301673e-05, + "loss": 0.0926026999950409, + "mean_token_accuracy": 0.9695659473538398, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.29128045216202736, + "eval_loss": 0.7450292110443115, + "eval_mean_token_accuracy": 0.8498771443616512, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.3963, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 2660 + }, + { + "entropy": 0.16164180357009172, + "epoch": 6.667496886674969, + "grad_norm": 0.5767946243286133, + "learning_rate": 6.841759539535419e-05, + "loss": 0.09291981458663941, + "mean_token_accuracy": 0.9687136687338352, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2897637223088464, + "eval_loss": 0.7503410577774048, + "eval_mean_token_accuracy": 0.8503315164599308, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.0653, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.998, + "step": 2680 + }, + { + "entropy": 0.17062523355707526, + "epoch": 6.717310087173101, + "grad_norm": 0.4974168539047241, + "learning_rate": 6.661961022304563e-05, + "loss": 0.09713236689567566, + "mean_token_accuracy": 0.9661971725523472, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2765843396963075, + "eval_loss": 0.7604002356529236, + "eval_mean_token_accuracy": 0.8521115277395692, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.1676, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 2700 + }, + { + "entropy": 0.17544092936441302, + "epoch": 6.767123287671232, + "grad_norm": 0.5523537993431091, + "learning_rate": 6.483565488389582e-05, + "loss": 0.09709116220474243, + "mean_token_accuracy": 0.9650957375764847, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.27939334659035814, + "eval_loss": 0.7534670829772949, + "eval_mean_token_accuracy": 0.851230604010959, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.2913, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 2720 + }, + { + "entropy": 0.15991022661328316, + "epoch": 6.816936488169365, + "grad_norm": 0.478551983833313, + "learning_rate": 6.306626739450311e-05, + "loss": 0.09564646482467651, + "mean_token_accuracy": 0.9679084822535515, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.27878295491601146, + "eval_loss": 0.7519959211349487, + "eval_mean_token_accuracy": 0.8510654949864676, + "eval_num_tokens": 6397720.0, + "eval_runtime": 85.9109, + "eval_samples_per_second": 16.005, + "eval_steps_per_second": 2.002, + "step": 2740 + }, + { + "entropy": 0.16824879590421915, + "epoch": 6.866749688667497, + "grad_norm": 0.6681098937988281, + "learning_rate": 6.131198137800108e-05, + "loss": 0.0962279736995697, + "mean_token_accuracy": 0.966830012947321, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.2834690434121808, + "eval_loss": 0.751922070980072, + "eval_mean_token_accuracy": 0.8521237577809844, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.3618, + "eval_samples_per_second": 15.921, + "eval_steps_per_second": 1.992, + "step": 2760 + }, + { + "entropy": 0.1518704930320382, + "epoch": 6.916562889165629, + "grad_norm": 0.5201290249824524, + "learning_rate": 5.957332590312513e-05, + "loss": 0.09010660648345947, + "mean_token_accuracy": 0.9693463340401649, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.28485129617674404, + "eval_loss": 0.7452457547187805, + "eval_mean_token_accuracy": 0.8512036796919135, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.4524, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.99, + "step": 2780 + }, + { + "entropy": 0.15512610590085388, + "epoch": 6.966376089663761, + "grad_norm": 0.42802050709724426, + "learning_rate": 5.785082532465233e-05, + "loss": 0.09320432543754578, + "mean_token_accuracy": 0.9686134628951549, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.27554594526110693, + "eval_loss": 0.7644653916358948, + "eval_mean_token_accuracy": 0.8513738523389018, + "eval_num_tokens": 6540175.0, + "eval_runtime": 85.7609, + "eval_samples_per_second": 16.033, + "eval_steps_per_second": 2.006, + "step": 2800 + }, + { + "entropy": 0.17524497526196334, + "epoch": 7.01494396014944, + "grad_norm": 0.3330269157886505, + "learning_rate": 5.6144999125263545e-05, + "loss": 0.0895616888999939, + "mean_token_accuracy": 0.9682766932707566, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.2735865569218647, + "eval_loss": 0.768479585647583, + "eval_mean_token_accuracy": 0.8503459383581959, + "eval_num_tokens": 6583767.0, + "eval_runtime": 85.7162, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.007, + "step": 2820 + }, + { + "entropy": 0.1403565663844347, + "epoch": 7.064757160647572, + "grad_norm": 0.35613498091697693, + "learning_rate": 5.4456361758874235e-05, + "loss": 0.07551313638687134, + "mean_token_accuracy": 0.9739301167428493, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.25941789089593775, + "eval_loss": 0.8209511637687683, + "eval_mean_token_accuracy": 0.8505055855873019, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.0943, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 2840 + }, + { + "entropy": 0.13500106502324344, + "epoch": 7.114570361145703, + "grad_norm": 0.34418627619743347, + "learning_rate": 5.2785422495482234e-05, + "loss": 0.07293946146965027, + "mean_token_accuracy": 0.9747208289802074, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.26482899772912954, + "eval_loss": 0.798904538154602, + "eval_mean_token_accuracy": 0.8511530233677044, + "eval_num_tokens": 6672946.0, + "eval_runtime": 85.7915, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.005, + "step": 2860 + }, + { + "entropy": 0.13127502552233636, + "epoch": 7.164383561643835, + "grad_norm": 0.4638441503047943, + "learning_rate": 5.113268526757892e-05, + "loss": 0.07121461629867554, + "mean_token_accuracy": 0.9756786689162255, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2645381211714689, + "eval_loss": 0.809101939201355, + "eval_mean_token_accuracy": 0.8514727898115335, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.84, + "eval_samples_per_second": 16.018, + "eval_steps_per_second": 2.004, + "step": 2880 + }, + { + "entropy": 0.1331390908919275, + "epoch": 7.214196762141968, + "grad_norm": 0.40206775069236755, + "learning_rate": 4.949864851817007e-05, + "loss": 0.07188264131546021, + "mean_token_accuracy": 0.9755406074225903, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.26244733283339544, + "eval_loss": 0.8143188953399658, + "eval_mean_token_accuracy": 0.8514358189909957, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.8546, + "eval_samples_per_second": 16.015, + "eval_steps_per_second": 2.003, + "step": 2900 + }, + { + "entropy": 0.13647331558167936, + "epoch": 7.2640099626401, + "grad_norm": 0.26405787467956543, + "learning_rate": 4.788380505045224e-05, + "loss": 0.07412450313568116, + "mean_token_accuracy": 0.9744274213910102, + "num_tokens": 6809678.0, + "step": 2920 + }, + { + "epoch": 7.2640099626401, + "eval_entropy": 0.2626111418182074, + "eval_loss": 0.8111525177955627, + "eval_mean_token_accuracy": 0.8512121695418691, + "eval_num_tokens": 6809678.0, + "eval_runtime": 85.9626, + "eval_samples_per_second": 15.995, + "eval_steps_per_second": 2.001, + "step": 2920 + }, + { + "entropy": 0.12644002586603165, + "epoch": 7.313823163138232, + "grad_norm": 0.27514681220054626, + "learning_rate": 4.6288641879189884e-05, + "loss": 0.06807711124420165, + "mean_token_accuracy": 0.9760703906416893, + "num_tokens": 6860750.0, + "step": 2940 + }, + { + "epoch": 7.313823163138232, + "eval_entropy": 0.26096762734097106, + "eval_loss": 0.8184595108032227, + "eval_mean_token_accuracy": 0.8501476153384807, + "eval_num_tokens": 6860750.0, + "eval_runtime": 85.9521, + "eval_samples_per_second": 15.997, + "eval_steps_per_second": 2.001, + "step": 2940 + }, + { + "entropy": 0.13920630998909472, + "epoch": 7.363636363636363, + "grad_norm": 0.23584705591201782, + "learning_rate": 4.4713640083838604e-05, + "loss": 0.07301607131958007, + "mean_token_accuracy": 0.9745715200901032, + "num_tokens": 6907092.0, + "step": 2960 + }, + { + "epoch": 7.363636363636363, + "eval_entropy": 0.2612536767021168, + "eval_loss": 0.8116245269775391, + "eval_mean_token_accuracy": 0.8510967350976412, + "eval_num_tokens": 6907092.0, + "eval_runtime": 85.6373, + "eval_samples_per_second": 16.056, + "eval_steps_per_second": 2.008, + "step": 2960 + }, + { + "entropy": 0.1349492883309722, + "epoch": 7.4134495641344955, + "grad_norm": 0.24552719295024872, + "learning_rate": 4.315927466345791e-05, + "loss": 0.07397544980049134, + "mean_token_accuracy": 0.9745095103979111, + "num_tokens": 6952700.0, + "step": 2980 + }, + { + "epoch": 7.4134495641344955, + "eval_entropy": 0.25796533306670744, + "eval_loss": 0.8266491293907166, + "eval_mean_token_accuracy": 0.8511653857868772, + "eval_num_tokens": 6952700.0, + "eval_runtime": 85.7462, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.006, + "step": 2980 + }, + { + "entropy": 0.14479175000451505, + "epoch": 7.463262764632628, + "grad_norm": 0.2846072018146515, + "learning_rate": 4.162601439345814e-05, + "loss": 0.07544798254966736, + "mean_token_accuracy": 0.9727819666266442, + "num_tokens": 6996430.0, + "step": 3000 + }, + { + "epoch": 7.463262764632628, + "eval_entropy": 0.2584348309698493, + "eval_loss": 0.8253348469734192, + "eval_mean_token_accuracy": 0.8511569815319638, + "eval_num_tokens": 6996430.0, + "eval_runtime": 86.2984, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 3000 + }, + { + "entropy": 0.14114196319133043, + "epoch": 7.51307596513076, + "grad_norm": 0.407966285943985, + "learning_rate": 4.011432168422419e-05, + "loss": 0.0736398994922638, + "mean_token_accuracy": 0.9741654269397259, + "num_tokens": 7042038.0, + "step": 3020 + }, + { + "epoch": 7.51307596513076, + "eval_entropy": 0.25232676260693127, + "eval_loss": 0.8296052813529968, + "eval_mean_token_accuracy": 0.8523298349491385, + "eval_num_tokens": 7042038.0, + "eval_runtime": 85.8445, + "eval_samples_per_second": 16.017, + "eval_steps_per_second": 2.004, + "step": 3020 + }, + { + "entropy": 0.1353456223383546, + "epoch": 7.562889165628892, + "grad_norm": 0.2712634801864624, + "learning_rate": 3.8624652441658684e-05, + "loss": 0.07362412214279175, + "mean_token_accuracy": 0.9747945807874203, + "num_tokens": 7089390.0, + "step": 3040 + }, + { + "epoch": 7.562889165628892, + "eval_entropy": 0.2579477243991785, + "eval_loss": 0.8274564743041992, + "eval_mean_token_accuracy": 0.8517705212498821, + "eval_num_tokens": 7089390.0, + "eval_runtime": 85.8222, + "eval_samples_per_second": 16.022, + "eval_steps_per_second": 2.004, + "step": 3040 + }, + { + "entropy": 0.1296080862637609, + "epoch": 7.6127023661270234, + "grad_norm": 0.2371893972158432, + "learning_rate": 3.715745592968707e-05, + "loss": 0.06971035599708557, + "mean_token_accuracy": 0.9759043246507645, + "num_tokens": 7138002.0, + "step": 3060 + }, + { + "epoch": 7.6127023661270234, + "eval_entropy": 0.25391967083479083, + "eval_loss": 0.8197130560874939, + "eval_mean_token_accuracy": 0.8522267875283264, + "eval_num_tokens": 7138002.0, + "eval_runtime": 85.8796, + "eval_samples_per_second": 16.011, + "eval_steps_per_second": 2.003, + "step": 3060 + }, + { + "entropy": 0.1311203008517623, + "epoch": 7.662515566625156, + "grad_norm": 0.22499267756938934, + "learning_rate": 3.5713174634765967e-05, + "loss": 0.07176244258880615, + "mean_token_accuracy": 0.9754939571022987, + "num_tokens": 7185520.0, + "step": 3080 + }, + { + "epoch": 7.662515566625156, + "eval_entropy": 0.2526215241225653, + "eval_loss": 0.8265154361724854, + "eval_mean_token_accuracy": 0.8519952584837758, + "eval_num_tokens": 7185520.0, + "eval_runtime": 85.8746, + "eval_samples_per_second": 16.012, + "eval_steps_per_second": 2.003, + "step": 3080 + }, + { + "entropy": 0.13420484317466616, + "epoch": 7.712328767123288, + "grad_norm": 0.2398064285516739, + "learning_rate": 3.4292244132434866e-05, + "loss": 0.07559212446212768, + "mean_token_accuracy": 0.9743142127990723, + "num_tokens": 7232170.0, + "step": 3100 + }, + { + "epoch": 7.712328767123288, + "eval_entropy": 0.2484562756537005, + "eval_loss": 0.8312150239944458, + "eval_mean_token_accuracy": 0.8528405119513356, + "eval_num_tokens": 7232170.0, + "eval_runtime": 85.7896, + "eval_samples_per_second": 16.028, + "eval_steps_per_second": 2.005, + "step": 3100 + }, + { + "entropy": 0.11965563679113984, + "epoch": 7.76214196762142, + "grad_norm": 0.3408384919166565, + "learning_rate": 3.2895092955952746e-05, + "loss": 0.0661750853061676, + "mean_token_accuracy": 0.9776600524783134, + "num_tokens": 7282846.0, + "step": 3120 + }, + { + "epoch": 7.76214196762142, + "eval_entropy": 0.2522421533804993, + "eval_loss": 0.8327009677886963, + "eval_mean_token_accuracy": 0.8524222023958383, + "eval_num_tokens": 7282846.0, + "eval_runtime": 86.1769, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 1.996, + "step": 3120 + }, + { + "entropy": 0.13388084415346385, + "epoch": 7.811955168119551, + "grad_norm": 0.35418516397476196, + "learning_rate": 3.152214246705829e-05, + "loss": 0.07149899601936341, + "mean_token_accuracy": 0.9747635535895824, + "num_tokens": 7331518.0, + "step": 3140 + }, + { + "epoch": 7.811955168119551, + "eval_entropy": 0.25038352296795957, + "eval_loss": 0.836457371711731, + "eval_mean_token_accuracy": 0.8526130665180295, + "eval_num_tokens": 7331518.0, + "eval_runtime": 85.6099, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.009, + "step": 3140 + }, + { + "entropy": 0.13530643959529698, + "epoch": 7.861768368617684, + "grad_norm": 0.38060539960861206, + "learning_rate": 3.017380672889291e-05, + "loss": 0.07116585969924927, + "mean_token_accuracy": 0.973284512758255, + "num_tokens": 7379056.0, + "step": 3160 + }, + { + "epoch": 7.861768368617684, + "eval_entropy": 0.255092611319797, + "eval_loss": 0.8314701914787292, + "eval_mean_token_accuracy": 0.8520913099826768, + "eval_num_tokens": 7379056.0, + "eval_runtime": 85.877, + "eval_samples_per_second": 16.011, + "eval_steps_per_second": 2.003, + "step": 3160 + }, + { + "entropy": 0.13383390177041293, + "epoch": 7.911581569115816, + "grad_norm": 0.3827536106109619, + "learning_rate": 2.8850492381124808e-05, + "loss": 0.07305437326431274, + "mean_token_accuracy": 0.9750778004527092, + "num_tokens": 7424770.0, + "step": 3180 + }, + { + "epoch": 7.911581569115816, + "eval_entropy": 0.25416371157003004, + "eval_loss": 0.8206402063369751, + "eval_mean_token_accuracy": 0.852779901651449, + "eval_num_tokens": 7424770.0, + "eval_runtime": 86.1015, + "eval_samples_per_second": 15.97, + "eval_steps_per_second": 1.998, + "step": 3180 + }, + { + "entropy": 0.1395680439658463, + "epoch": 7.961394769613948, + "grad_norm": 0.3809775412082672, + "learning_rate": 2.7552598517312256e-05, + "loss": 0.07236042022705078, + "mean_token_accuracy": 0.9731538116931915, + "num_tokens": 7470804.0, + "step": 3200 + }, + { + "epoch": 7.961394769613948, + "eval_entropy": 0.25528111975899964, + "eval_loss": 0.8230037093162537, + "eval_mean_token_accuracy": 0.8526452603035195, + "eval_num_tokens": 7470804.0, + "eval_runtime": 85.7895, + "eval_samples_per_second": 16.028, + "eval_steps_per_second": 2.005, + "step": 3200 + }, + { + "entropy": 0.12193699864049752, + "epoch": 8.009962640099626, + "grad_norm": 0.11854425817728043, + "learning_rate": 2.6280516564542205e-05, + "loss": 0.06617764234542847, + "mean_token_accuracy": 0.977179691577569, + "num_tokens": 7518110.0, + "step": 3220 + }, + { + "epoch": 8.009962640099626, + "eval_entropy": 0.25100527677771656, + "eval_loss": 0.8393343687057495, + "eval_mean_token_accuracy": 0.8522553132023922, + "eval_num_tokens": 7518110.0, + "eval_runtime": 85.8837, + "eval_samples_per_second": 16.01, + "eval_steps_per_second": 2.003, + "step": 3220 + }, + { + "entropy": 0.12788885813206435, + "epoch": 8.059775840597759, + "grad_norm": 0.16094881296157837, + "learning_rate": 2.50346301653812e-05, + "loss": 0.06274186968803405, + "mean_token_accuracy": 0.9766994707286358, + "num_tokens": 7565539.0, + "step": 3240 + }, + { + "epoch": 8.059775840597759, + "eval_entropy": 0.24409458682287571, + "eval_loss": 0.874617338180542, + "eval_mean_token_accuracy": 0.8521041180505309, + "eval_num_tokens": 7565539.0, + "eval_runtime": 86.2656, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 3240 + }, + { + "entropy": 0.12464155335910618, + "epoch": 8.10958904109589, + "grad_norm": 0.16893954575061798, + "learning_rate": 2.381531506217437e-05, + "loss": 0.06093020439147949, + "mean_token_accuracy": 0.9776258453726768, + "num_tokens": 7612578.0, + "step": 3260 + }, + { + "epoch": 8.10958904109589, + "eval_entropy": 0.24396493017326953, + "eval_loss": 0.891161322593689, + "eval_mean_token_accuracy": 0.8515338024427724, + "eval_num_tokens": 7612578.0, + "eval_runtime": 85.9061, + "eval_samples_per_second": 16.006, + "eval_steps_per_second": 2.002, + "step": 3260 + }, + { + "entropy": 0.12345920228399336, + "epoch": 8.159402241594023, + "grad_norm": 0.14332273602485657, + "learning_rate": 2.262293898372616e-05, + "loss": 0.061289966106414795, + "mean_token_accuracy": 0.9762230902910233, + "num_tokens": 7660157.0, + "step": 3280 + }, + { + "epoch": 8.159402241594023, + "eval_entropy": 0.2481445314059424, + "eval_loss": 0.8922848105430603, + "eval_mean_token_accuracy": 0.8514944855556932, + "eval_num_tokens": 7660157.0, + "eval_runtime": 85.5201, + "eval_samples_per_second": 16.078, + "eval_steps_per_second": 2.011, + "step": 3280 + }, + { + "entropy": 0.12298110066913068, + "epoch": 8.209215442092155, + "grad_norm": 0.21848882734775543, + "learning_rate": 2.1457861534398633e-05, + "loss": 0.05986443758010864, + "mean_token_accuracy": 0.9786281704902648, + "num_tokens": 7709745.0, + "step": 3300 + }, + { + "epoch": 8.209215442092155, + "eval_entropy": 0.24329388124305149, + "eval_loss": 0.9021085500717163, + "eval_mean_token_accuracy": 0.8521762625422589, + "eval_num_tokens": 7709745.0, + "eval_runtime": 85.955, + "eval_samples_per_second": 15.997, + "eval_steps_per_second": 2.001, + "step": 3300 + }, + { + "entropy": 0.13265180448070168, + "epoch": 8.259028642590286, + "grad_norm": 0.18067947030067444, + "learning_rate": 2.0320434085659692e-05, + "loss": 0.06724961400032044, + "mean_token_accuracy": 0.975098168104887, + "num_tokens": 7753571.0, + "step": 3320 + }, + { + "epoch": 8.259028642590286, + "eval_entropy": 0.2433211464694766, + "eval_loss": 0.9094350337982178, + "eval_mean_token_accuracy": 0.8520150094531304, + "eval_num_tokens": 7753571.0, + "eval_runtime": 85.7989, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.005, + "step": 3320 + }, + { + "entropy": 0.11949320202693343, + "epoch": 8.308841843088418, + "grad_norm": 0.17020289599895477, + "learning_rate": 1.9210999670114196e-05, + "loss": 0.0634455680847168, + "mean_token_accuracy": 0.9771294385194779, + "num_tokens": 7799310.0, + "step": 3340 + }, + { + "epoch": 8.308841843088418, + "eval_entropy": 0.24345201219237128, + "eval_loss": 0.9021793603897095, + "eval_mean_token_accuracy": 0.8520745697409607, + "eval_num_tokens": 7799310.0, + "eval_runtime": 86.0883, + "eval_samples_per_second": 15.972, + "eval_steps_per_second": 1.998, + "step": 3340 + }, + { + "entropy": 0.12065747743472457, + "epoch": 8.35865504358655, + "grad_norm": 0.16789060831069946, + "learning_rate": 1.8129892878049886e-05, + "loss": 0.061494195461273195, + "mean_token_accuracy": 0.9779584899544715, + "num_tokens": 7846447.0, + "step": 3360 + }, + { + "epoch": 8.35865504358655, + "eval_entropy": 0.24093415042342142, + "eval_loss": 0.9006755352020264, + "eval_mean_token_accuracy": 0.852174230786257, + "eval_num_tokens": 7846447.0, + "eval_runtime": 85.9011, + "eval_samples_per_second": 16.007, + "eval_steps_per_second": 2.002, + "step": 3360 + }, + { + "entropy": 0.13125578537583352, + "epoch": 8.408468244084682, + "grad_norm": 0.1662452220916748, + "learning_rate": 1.70774397565298e-05, + "loss": 0.06685600876808166, + "mean_token_accuracy": 0.9744067586958408, + "num_tokens": 7890283.0, + "step": 3380 + }, + { + "epoch": 8.408468244084682, + "eval_entropy": 0.24062153688350388, + "eval_loss": 0.9078915119171143, + "eval_mean_token_accuracy": 0.8523201647886011, + "eval_num_tokens": 7890283.0, + "eval_runtime": 86.0201, + "eval_samples_per_second": 15.985, + "eval_steps_per_second": 2.0, + "step": 3380 + }, + { + "entropy": 0.11986117120832204, + "epoch": 8.458281444582815, + "grad_norm": 0.19571948051452637, + "learning_rate": 1.6053957711060606e-05, + "loss": 0.06411095261573792, + "mean_token_accuracy": 0.9770627245306969, + "num_tokens": 7936518.0, + "step": 3400 + }, + { + "epoch": 8.458281444582815, + "eval_entropy": 0.24352820347561394, + "eval_loss": 0.9058943390846252, + "eval_mean_token_accuracy": 0.8519382792156797, + "eval_num_tokens": 7936518.0, + "eval_runtime": 85.966, + "eval_samples_per_second": 15.995, + "eval_steps_per_second": 2.001, + "step": 3400 + }, + { + "entropy": 0.12857897616922856, + "epoch": 8.508094645080947, + "grad_norm": 0.2609264850616455, + "learning_rate": 1.5059755409867613e-05, + "loss": 0.06473397612571716, + "mean_token_accuracy": 0.9764650195837021, + "num_tokens": 7981966.0, + "step": 3420 + }, + { + "epoch": 8.508094645080947, + "eval_entropy": 0.24032609000108962, + "eval_loss": 0.9077776074409485, + "eval_mean_token_accuracy": 0.8517829197090726, + "eval_num_tokens": 7981966.0, + "eval_runtime": 86.6059, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 3420 + }, + { + "entropy": 0.12348870886489749, + "epoch": 8.557907845579079, + "grad_norm": 0.19537609815597534, + "learning_rate": 1.409513269080473e-05, + "loss": 0.06481348872184753, + "mean_token_accuracy": 0.9769559659063816, + "num_tokens": 8028367.0, + "step": 3440 + }, + { + "epoch": 8.557907845579079, + "eval_entropy": 0.2404322574824788, + "eval_loss": 0.9057720899581909, + "eval_mean_token_accuracy": 0.8521037981953732, + "eval_num_tokens": 8028367.0, + "eval_runtime": 86.166, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.996, + "step": 3440 + }, + { + "entropy": 0.12040232736617326, + "epoch": 8.607721046077211, + "grad_norm": 0.3310582935810089, + "learning_rate": 1.3160380470927183e-05, + "loss": 0.06468871235847473, + "mean_token_accuracy": 0.9768650442361831, + "num_tokens": 8074934.0, + "step": 3460 + }, + { + "epoch": 8.607721046077211, + "eval_entropy": 0.24118655876711356, + "eval_loss": 0.9028318524360657, + "eval_mean_token_accuracy": 0.8521025340224422, + "eval_num_tokens": 8074934.0, + "eval_runtime": 85.3668, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.015, + "step": 3460 + }, + { + "entropy": 0.12328103906475008, + "epoch": 8.657534246575342, + "grad_norm": 0.12836167216300964, + "learning_rate": 1.2255780658755122e-05, + "loss": 0.06229386329650879, + "mean_token_accuracy": 0.9763277888298034, + "num_tokens": 8122775.0, + "step": 3480 + }, + { + "epoch": 8.657534246575342, + "eval_entropy": 0.24194598145956217, + "eval_loss": 0.9009329080581665, + "eval_mean_token_accuracy": 0.8521693289973015, + "eval_num_tokens": 8122775.0, + "eval_runtime": 85.9415, + "eval_samples_per_second": 15.999, + "eval_steps_per_second": 2.001, + "step": 3480 + }, + { + "entropy": 0.11321646976284683, + "epoch": 8.707347447073474, + "grad_norm": 0.15656894445419312, + "learning_rate": 1.1381606069253786e-05, + "loss": 0.05908188819885254, + "mean_token_accuracy": 0.9779504477977753, + "num_tokens": 8174307.0, + "step": 3500 + }, + { + "epoch": 8.707347447073474, + "eval_entropy": 0.24121542517528977, + "eval_loss": 0.9016091823577881, + "eval_mean_token_accuracy": 0.8521790667328724, + "eval_num_tokens": 8174307.0, + "eval_runtime": 85.7465, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.006, + "step": 3500 + }, + { + "entropy": 0.12657046681270004, + "epoch": 8.757160647571606, + "grad_norm": 0.22597502171993256, + "learning_rate": 1.053812034155629e-05, + "loss": 0.06244581937789917, + "mean_token_accuracy": 0.976795207709074, + "num_tokens": 8222808.0, + "step": 3520 + }, + { + "epoch": 8.757160647571606, + "eval_entropy": 0.23877542708502258, + "eval_loss": 0.9069110155105591, + "eval_mean_token_accuracy": 0.8522880177858264, + "eval_num_tokens": 8222808.0, + "eval_runtime": 85.7792, + "eval_samples_per_second": 16.03, + "eval_steps_per_second": 2.005, + "step": 3520 + }, + { + "entropy": 0.11422101808711886, + "epoch": 8.806973848069738, + "grad_norm": 0.21139323711395264, + "learning_rate": 9.725577859453502e-06, + "loss": 0.05988085865974426, + "mean_token_accuracy": 0.9779510758817196, + "num_tokens": 8273335.0, + "step": 3540 + }, + { + "epoch": 8.806973848069738, + "eval_entropy": 0.2393161087881687, + "eval_loss": 0.9033801555633545, + "eval_mean_token_accuracy": 0.8522614209457885, + "eval_num_tokens": 8273335.0, + "eval_runtime": 85.5594, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 3540 + }, + { + "entropy": 0.13810604228638113, + "epoch": 8.85678704856787, + "grad_norm": 0.24571993947029114, + "learning_rate": 8.944223674675537e-06, + "loss": 0.07036117911338806, + "mean_token_accuracy": 0.9734892748296261, + "num_tokens": 8315235.0, + "step": 3560 + }, + { + "epoch": 8.85678704856787, + "eval_entropy": 0.23998506947658782, + "eval_loss": 0.9009848833084106, + "eval_mean_token_accuracy": 0.8521793619837872, + "eval_num_tokens": 8315235.0, + "eval_runtime": 86.0974, + "eval_samples_per_second": 15.97, + "eval_steps_per_second": 1.998, + "step": 3560 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.509752732044042e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3580/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3580/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3580/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3580/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3580/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3580/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3580/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3580/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3580/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3580/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3580/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3580/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3580/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3580/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..cfbb82c3a37c503f8111d7c528df3fb3783af438 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3580/trainer_state.json @@ -0,0 +1,3793 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 8.906600249066003, + "eval_steps": 20, + "global_step": 3580, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + }, + { + "entropy": 0.561330484598875, + "epoch": 1.891656288916563, + "grad_norm": 0.6722865700721741, + "learning_rate": 0.0002208867897174789, + "loss": 0.499837589263916, + "mean_token_accuracy": 0.8518734864890576, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.5865232653396074, + "eval_loss": 0.5437926650047302, + "eval_mean_token_accuracy": 0.8450997017843779, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4116, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.547389242425561, + "epoch": 1.9414694894146949, + "grad_norm": 0.7935577034950256, + "learning_rate": 0.00022027119820226907, + "loss": 0.4977591514587402, + "mean_token_accuracy": 0.8539491161704064, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.5290903090391048, + "eval_loss": 0.5409526824951172, + "eval_mean_token_accuracy": 0.8497545698354411, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.7262, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 780 + }, + { + "entropy": 0.5687909748405218, + "epoch": 1.9912826899128269, + "grad_norm": 0.6180546283721924, + "learning_rate": 0.00021962329729698345, + "loss": 0.5109643459320068, + "mean_token_accuracy": 0.8521598495543004, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.5503541858390321, + "eval_loss": 0.5361555218696594, + "eval_mean_token_accuracy": 0.8510884285666221, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.3339, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 800 + }, + { + "entropy": 0.4739728841261986, + "epoch": 2.0398505603985058, + "grad_norm": 0.8058829307556152, + "learning_rate": 0.0002189432823996982, + "loss": 0.4204097747802734, + "mean_token_accuracy": 0.8728981889211215, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.5077334992414297, + "eval_loss": 0.5531114339828491, + "eval_mean_token_accuracy": 0.8489257208136625, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.4801, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.989, + "step": 820 + }, + { + "entropy": 0.4594309840351343, + "epoch": 2.0896637608966375, + "grad_norm": 0.6906896829605103, + "learning_rate": 0.0002182313585936314, + "loss": 0.4071959495544434, + "mean_token_accuracy": 0.8732857562601566, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.49850136994622474, + "eval_loss": 0.5486204624176025, + "eval_mean_token_accuracy": 0.8507991450470548, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.3364, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.4881629109382629, + "epoch": 2.1394769613947697, + "grad_norm": 0.6343470215797424, + "learning_rate": 0.0002174877405852928, + "loss": 0.41669540405273436, + "mean_token_accuracy": 0.8711295068264008, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.49155513924914734, + "eval_loss": 0.555109441280365, + "eval_mean_token_accuracy": 0.8496399400539176, + "eval_num_tokens": 2008562.0, + "eval_runtime": 86.3295, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 860 + }, + { + "entropy": 0.4648668970912695, + "epoch": 2.1892901618929015, + "grad_norm": 0.8014165163040161, + "learning_rate": 0.00021671265263973133, + "loss": 0.4110250473022461, + "mean_token_accuracy": 0.8754166305065155, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.4909258722219356, + "eval_loss": 0.5539511442184448, + "eval_mean_token_accuracy": 0.8492401502160138, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.3468, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 880 + }, + { + "entropy": 0.4824485514312983, + "epoch": 2.2391033623910337, + "grad_norm": 0.6665191054344177, + "learning_rate": 0.00021590632851289967, + "loss": 0.4181404113769531, + "mean_token_accuracy": 0.8726993151009083, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.4986876940657926, + "eval_loss": 0.547695517539978, + "eval_mean_token_accuracy": 0.8501384708770486, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.3838, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 900 + }, + { + "entropy": 0.4751896943897009, + "epoch": 2.2889165628891655, + "grad_norm": 0.81158047914505, + "learning_rate": 0.00021506901138115678, + "loss": 0.40689678192138673, + "mean_token_accuracy": 0.8745221219956875, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.507153491121392, + "eval_loss": 0.5501641631126404, + "eval_mean_token_accuracy": 0.8495670116918032, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.0912, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 920 + }, + { + "entropy": 0.4873133715242147, + "epoch": 2.3387297633872977, + "grad_norm": 0.7218056321144104, + "learning_rate": 0.0002142009537679292, + "loss": 0.42701358795166017, + "mean_token_accuracy": 0.8695114746689796, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5202612736543943, + "eval_loss": 0.5491839051246643, + "eval_mean_token_accuracy": 0.8494071208460386, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.1142, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 940 + }, + { + "entropy": 0.4762951169162989, + "epoch": 2.3885429638854294, + "grad_norm": 0.7194424867630005, + "learning_rate": 0.0002133024174675534, + "loss": 0.42299847602844237, + "mean_token_accuracy": 0.8709790132939815, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4899340462546016, + "eval_loss": 0.5522511601448059, + "eval_mean_token_accuracy": 0.8492208258357159, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.463, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 960 + }, + { + "entropy": 0.49650347977876663, + "epoch": 2.4383561643835616, + "grad_norm": 0.8406022787094116, + "learning_rate": 0.0002123736734663221, + "loss": 0.4275330066680908, + "mean_token_accuracy": 0.8670595556497573, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.49691385654515996, + "eval_loss": 0.5491269826889038, + "eval_mean_token_accuracy": 0.850309816210769, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.17, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 980 + }, + { + "entropy": 0.48843890577554705, + "epoch": 2.488169364881694, + "grad_norm": 0.9082473516464233, + "learning_rate": 0.00021141500186075868, + "loss": 0.4309722423553467, + "mean_token_accuracy": 0.8686766296625137, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5543508351195691, + "eval_loss": 0.5478800535202026, + "eval_mean_token_accuracy": 0.8478029522784921, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.3835, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 1000 + }, + { + "entropy": 0.4777219031006098, + "epoch": 2.5379825653798256, + "grad_norm": 0.7448089122772217, + "learning_rate": 0.0002104266917731438, + "loss": 0.423325252532959, + "mean_token_accuracy": 0.8706337086856365, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.49857561550168106, + "eval_loss": 0.5511948466300964, + "eval_mean_token_accuracy": 0.8502220289651737, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.5399, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.988, + "step": 1020 + }, + { + "entropy": 0.4844174191355705, + "epoch": 2.587795765877958, + "grad_norm": 0.794029176235199, + "learning_rate": 0.00020940904126432, + "loss": 0.4176753044128418, + "mean_token_accuracy": 0.873535567522049, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.485467542222766, + "eval_loss": 0.5539286732673645, + "eval_mean_token_accuracy": 0.8495475081510322, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.135, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 1.997, + "step": 1040 + }, + { + "entropy": 0.49070929251611234, + "epoch": 2.6376089663760895, + "grad_norm": 0.7558256983757019, + "learning_rate": 0.0002083623572438007, + "loss": 0.42867293357849123, + "mean_token_accuracy": 0.8696666076779366, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.490822730889154, + "eval_loss": 0.5434785485267639, + "eval_mean_token_accuracy": 0.850568296950917, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.4933, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 1060 + }, + { + "entropy": 0.47806114703416824, + "epoch": 2.6874221668742218, + "grad_norm": 0.6608979105949402, + "learning_rate": 0.00020728695537721047, + "loss": 0.4289727687835693, + "mean_token_accuracy": 0.8693130135536193, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.5285773256490397, + "eval_loss": 0.5444230437278748, + "eval_mean_token_accuracy": 0.8498796481032704, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.7091, + "eval_samples_per_second": 15.858, + "eval_steps_per_second": 1.984, + "step": 1080 + }, + { + "entropy": 0.5046216730028391, + "epoch": 2.7372353673723535, + "grad_norm": 0.8428544998168945, + "learning_rate": 0.00020618315999108454, + "loss": 0.43131070137023925, + "mean_token_accuracy": 0.8701941035687923, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.49888394738352576, + "eval_loss": 0.5459766387939453, + "eval_mean_token_accuracy": 0.8511758872935938, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.2222, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.995, + "step": 1100 + }, + { + "entropy": 0.5212558470666409, + "epoch": 2.7870485678704857, + "grad_norm": 1.129318118095398, + "learning_rate": 0.00020505130397505635, + "loss": 0.44249300956726073, + "mean_token_accuracy": 0.8654101334512234, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5179622324053631, + "eval_loss": 0.5522801280021667, + "eval_mean_token_accuracy": 0.8497019947268242, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.1903, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.996, + "step": 1120 + }, + { + "entropy": 0.4988406613469124, + "epoch": 2.8368617683686175, + "grad_norm": 0.6460545063018799, + "learning_rate": 0.00020389172868146263, + "loss": 0.4386270523071289, + "mean_token_accuracy": 0.8690383620560169, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.5042278484203094, + "eval_loss": 0.5433034300804138, + "eval_mean_token_accuracy": 0.8497674451317898, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.3028, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.993, + "step": 1140 + }, + { + "entropy": 0.4926559619605541, + "epoch": 2.8866749688667497, + "grad_norm": 0.8199329972267151, + "learning_rate": 0.00020270478382239615, + "loss": 0.4313485145568848, + "mean_token_accuracy": 0.8674727231264114, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.503873193160046, + "eval_loss": 0.5388111472129822, + "eval_mean_token_accuracy": 0.8526195034731266, + "eval_num_tokens": 2710196.0, + "eval_runtime": 86.4054, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.991, + "step": 1160 + }, + { + "entropy": 0.5020013231784105, + "epoch": 2.936488169364882, + "grad_norm": 0.7344821095466614, + "learning_rate": 0.00020149082736423723, + "loss": 0.43590536117553713, + "mean_token_accuracy": 0.8671772189438343, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5368241809828337, + "eval_loss": 0.5355703830718994, + "eval_mean_token_accuracy": 0.8517617773871089, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.2945, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1180 + }, + { + "entropy": 0.5112275708466768, + "epoch": 2.9863013698630136, + "grad_norm": 0.6951606869697571, + "learning_rate": 0.00020025022541969622, + "loss": 0.43579301834106443, + "mean_token_accuracy": 0.8641206480562686, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.5066795706055885, + "eval_loss": 0.5415249466896057, + "eval_mean_token_accuracy": 0.8493563373421513, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.5005, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.988, + "step": 1200 + }, + { + "entropy": 0.42298635305502474, + "epoch": 3.0348692403486925, + "grad_norm": 0.8201794028282166, + "learning_rate": 0.00019898335213739863, + "loss": 0.35593905448913576, + "mean_token_accuracy": 0.889238600547497, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.4584170470750609, + "eval_loss": 0.569487452507019, + "eval_mean_token_accuracy": 0.8495814173027526, + "eval_num_tokens": 2848509.0, + "eval_runtime": 86.2281, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 1220 + }, + { + "entropy": 0.37450140453875064, + "epoch": 3.0846824408468243, + "grad_norm": 0.7308394908905029, + "learning_rate": 0.0001976905895890471, + "loss": 0.307823920249939, + "mean_token_accuracy": 0.9001288741827012, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.45185995916294497, + "eval_loss": 0.5672881603240967, + "eval_mean_token_accuracy": 0.8511318519364955, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.0819, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.998, + "step": 1240 + }, + { + "entropy": 0.3887945845723152, + "epoch": 3.1344956413449565, + "grad_norm": 0.7299330830574036, + "learning_rate": 0.0001963723276541939, + "loss": 0.32047903537750244, + "mean_token_accuracy": 0.8960984498262405, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.44865354549053105, + "eval_loss": 0.5666037201881409, + "eval_mean_token_accuracy": 0.8496572649063066, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 1260 + }, + { + "entropy": 0.39677664265036583, + "epoch": 3.1843088418430883, + "grad_norm": 0.9533219933509827, + "learning_rate": 0.00019502896390265838, + "loss": 0.3253983497619629, + "mean_token_accuracy": 0.8964207418262958, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.4641980809527774, + "eval_loss": 0.5814996957778931, + "eval_mean_token_accuracy": 0.8485886212005171, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.7784, + "eval_samples_per_second": 15.845, + "eval_steps_per_second": 1.982, + "step": 1280 + }, + { + "entropy": 0.39210722744464876, + "epoch": 3.2341220423412205, + "grad_norm": 0.7447651028633118, + "learning_rate": 0.00019366090347462545, + "loss": 0.3276803970336914, + "mean_token_accuracy": 0.8930055953562259, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43595615254585135, + "eval_loss": 0.5722188353538513, + "eval_mean_token_accuracy": 0.8501105755567551, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.5271, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 1300 + }, + { + "entropy": 0.3684127271175385, + "epoch": 3.2839352428393527, + "grad_norm": 0.6934201121330261, + "learning_rate": 0.00019226855895846078, + "loss": 0.3156379222869873, + "mean_token_accuracy": 0.8976306475698947, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.4628148723480313, + "eval_loss": 0.5631352066993713, + "eval_mean_token_accuracy": 0.8504934813394103, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.3436, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 1320 + }, + { + "entropy": 0.4073401909321547, + "epoch": 3.3337484433374844, + "grad_norm": 0.9386897683143616, + "learning_rate": 0.00019085235026627994, + "loss": 0.34265310764312745, + "mean_token_accuracy": 0.8902062118053437, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.46455050623694133, + "eval_loss": 0.5586736798286438, + "eval_mean_token_accuracy": 0.8506874702004499, + "eval_num_tokens": 3132874.0, + "eval_runtime": 86.1286, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.997, + "step": 1340 + }, + { + "entropy": 0.4046429242938757, + "epoch": 3.383561643835616, + "grad_norm": 0.9633992314338684, + "learning_rate": 0.00018941270450730836, + "loss": 0.33816893100738527, + "mean_token_accuracy": 0.8927541889250279, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.46846531660750856, + "eval_loss": 0.561501681804657, + "eval_mean_token_accuracy": 0.8496256377114806, + "eval_num_tokens": 3178055.0, + "eval_runtime": 86.685, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1360 + }, + { + "entropy": 0.39872407019138334, + "epoch": 3.4333748443337484, + "grad_norm": 0.7786458730697632, + "learning_rate": 0.00018795005585907113, + "loss": 0.33342490196228025, + "mean_token_accuracy": 0.8944805048406124, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.42709505973860273, + "eval_loss": 0.5751848220825195, + "eval_mean_token_accuracy": 0.8507290447867194, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.6892, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 1380 + }, + { + "entropy": 0.3923338124528527, + "epoch": 3.4831880448318806, + "grad_norm": 0.9305956363677979, + "learning_rate": 0.0001864648454364511, + "loss": 0.33188116550445557, + "mean_token_accuracy": 0.8943330392241478, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.4386174779298694, + "eval_loss": 0.5680831074714661, + "eval_mean_token_accuracy": 0.8513129727784977, + "eval_num_tokens": 3274096.0, + "eval_runtime": 86.2671, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 1400 + }, + { + "entropy": 0.3856233984231949, + "epoch": 3.5330012453300124, + "grad_norm": 1.0362752676010132, + "learning_rate": 0.0001849575211586545, + "loss": 0.33098697662353516, + "mean_token_accuracy": 0.8961390435695649, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4574795474493226, + "eval_loss": 0.5630439519882202, + "eval_mean_token_accuracy": 0.8520988873964133, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.6035, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 1420 + }, + { + "entropy": 0.39812871962785723, + "epoch": 3.5828144458281446, + "grad_norm": 0.7807195782661438, + "learning_rate": 0.0001834285376141247, + "loss": 0.3333771228790283, + "mean_token_accuracy": 0.8930827379226685, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.4556825893909432, + "eval_loss": 0.5689062476158142, + "eval_mean_token_accuracy": 0.8507103507601937, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.1606, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.996, + "step": 1440 + }, + { + "entropy": 0.4147744856774807, + "epoch": 3.6326276463262763, + "grad_norm": 0.6429352164268494, + "learning_rate": 0.00018187835592344443, + "loss": 0.3482560873031616, + "mean_token_accuracy": 0.8910200245678425, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.46600024540757023, + "eval_loss": 0.5609709024429321, + "eval_mean_token_accuracy": 0.8491220876227977, + "eval_num_tokens": 3415600.0, + "eval_runtime": 86.8039, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1460 + }, + { + "entropy": 0.40425071083009245, + "epoch": 3.6824408468244085, + "grad_norm": 0.8613698482513428, + "learning_rate": 0.0001803074436002682, + "loss": 0.342916464805603, + "mean_token_accuracy": 0.8916418336331844, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.43855057899342026, + "eval_loss": 0.5720968246459961, + "eval_mean_token_accuracy": 0.8500823641932288, + "eval_num_tokens": 3460471.0, + "eval_runtime": 86.6746, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1480 + }, + { + "entropy": 0.39465143866837027, + "epoch": 3.7322540473225407, + "grad_norm": 0.6285189986228943, + "learning_rate": 0.0001787162744103265, + "loss": 0.3424591779708862, + "mean_token_accuracy": 0.8906558901071548, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4509461877304454, + "eval_loss": 0.5590082406997681, + "eval_mean_token_accuracy": 0.8511747371318729, + "eval_num_tokens": 3507647.0, + "eval_runtime": 86.8126, + "eval_samples_per_second": 15.839, + "eval_steps_per_second": 1.981, + "step": 1500 + }, + { + "entropy": 0.4021005939692259, + "epoch": 3.7820672478206725, + "grad_norm": 0.8821248412132263, + "learning_rate": 0.00017710532822854468, + "loss": 0.3462103843688965, + "mean_token_accuracy": 0.889109355956316, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.4502199075596277, + "eval_loss": 0.566046416759491, + "eval_mean_token_accuracy": 0.8501714208098345, + "eval_num_tokens": 3548934.0, + "eval_runtime": 86.8336, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.981, + "step": 1520 + }, + { + "entropy": 0.4017397932708263, + "epoch": 3.8318804483188043, + "grad_norm": 0.8400952816009521, + "learning_rate": 0.0001754750908943189, + "loss": 0.34890995025634763, + "mean_token_accuracy": 0.8892098367214203, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.4614003023435903, + "eval_loss": 0.5617933869361877, + "eval_mean_token_accuracy": 0.8515863616106122, + "eval_num_tokens": 3597186.0, + "eval_runtime": 86.4609, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 1540 + }, + { + "entropy": 0.4112051840871572, + "epoch": 3.8816936488169365, + "grad_norm": 0.769478440284729, + "learning_rate": 0.0001738260540649939, + "loss": 0.34711437225341796, + "mean_token_accuracy": 0.8911717928946018, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4540443811998811, + "eval_loss": 0.5576469898223877, + "eval_mean_token_accuracy": 0.8512079674144124, + "eval_num_tokens": 3646646.0, + "eval_runtime": 86.5103, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 1560 + }, + { + "entropy": 0.41105241514742374, + "epoch": 3.9315068493150687, + "grad_norm": 0.8468427062034607, + "learning_rate": 0.00017215871506758568, + "loss": 0.3433023452758789, + "mean_token_accuracy": 0.8898739732801915, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.4707539707075718, + "eval_loss": 0.5641466379165649, + "eval_mean_token_accuracy": 0.8495440957851188, + "eval_num_tokens": 3689560.0, + "eval_runtime": 86.609, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.986, + "step": 1580 + }, + { + "entropy": 0.41016379147768023, + "epoch": 3.9813200498132004, + "grad_norm": 0.7482675313949585, + "learning_rate": 0.0001704735767487946, + "loss": 0.34550890922546384, + "mean_token_accuracy": 0.8893028847873211, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.46391099864660307, + "eval_loss": 0.5593640804290771, + "eval_mean_token_accuracy": 0.8510130581467651, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.3975, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 1600 + }, + { + "entropy": 0.33167599791135544, + "epoch": 4.029887920298879, + "grad_norm": 0.9435692429542542, + "learning_rate": 0.00016877114732335337, + "loss": 0.2716026544570923, + "mean_token_accuracy": 0.9133149828666296, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.38499350005457567, + "eval_loss": 0.6298249363899231, + "eval_mean_token_accuracy": 0.8488117071778275, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.2933, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1620 + }, + { + "entropy": 0.3000166634097695, + "epoch": 4.0797011207970115, + "grad_norm": 0.8080845475196838, + "learning_rate": 0.0001670519402207569, + "loss": 0.22617182731628419, + "mean_token_accuracy": 0.9253474645316601, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.370110988703578, + "eval_loss": 0.6338461637496948, + "eval_mean_token_accuracy": 0.8485634801692741, + "eval_num_tokens": 3828830.0, + "eval_runtime": 85.9508, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.001, + "step": 1640 + }, + { + "entropy": 0.2986910421401262, + "epoch": 4.129514321295143, + "grad_norm": 0.7310900092124939, + "learning_rate": 0.0001653164739304185, + "loss": 0.22367463111877442, + "mean_token_accuracy": 0.9252275295555592, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.3944379702037157, + "eval_loss": 0.6109381914138794, + "eval_mean_token_accuracy": 0.849291454220927, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.6728, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1660 + }, + { + "entropy": 0.3095553796738386, + "epoch": 4.179327521793275, + "grad_norm": 0.7059140801429749, + "learning_rate": 0.0001635652718453007, + "loss": 0.23651680946350098, + "mean_token_accuracy": 0.9208931416273117, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.3910588648949945, + "eval_loss": 0.6104469299316406, + "eval_mean_token_accuracy": 0.8486883893262508, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7612, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.982, + "step": 1680 + }, + { + "entropy": 0.3001101028174162, + "epoch": 4.229140722291407, + "grad_norm": 0.6787802577018738, + "learning_rate": 0.00016179886210406728, + "loss": 0.23130471706390382, + "mean_token_accuracy": 0.9233332790434361, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3794369170832079, + "eval_loss": 0.6182110905647278, + "eval_mean_token_accuracy": 0.8495433777570724, + "eval_num_tokens": 3967474.0, + "eval_runtime": 85.94, + "eval_samples_per_second": 16.0, + "eval_steps_per_second": 2.001, + "step": 1700 + }, + { + "entropy": 0.3031421799212694, + "epoch": 4.2789539227895395, + "grad_norm": 0.9732038378715515, + "learning_rate": 0.0001600177774318036, + "loss": 0.2359529733657837, + "mean_token_accuracy": 0.9217648565769195, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3923123094231583, + "eval_loss": 0.6057384610176086, + "eval_mean_token_accuracy": 0.8508818288182103, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7647, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.29365369994193313, + "epoch": 4.328767123287671, + "grad_norm": 0.7681498527526855, + "learning_rate": 0.0001582225549793541, + "loss": 0.2269371747970581, + "mean_token_accuracy": 0.9245341829955578, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.4011661055129628, + "eval_loss": 0.6144486665725708, + "eval_mean_token_accuracy": 0.8480324357054955, + "eval_num_tokens": 4062594.0, + "eval_runtime": 87.1306, + "eval_samples_per_second": 15.781, + "eval_steps_per_second": 1.974, + "step": 1740 + }, + { + "entropy": 0.29396994728595016, + "epoch": 4.378580323785803, + "grad_norm": 1.0001007318496704, + "learning_rate": 0.0001564137361613248, + "loss": 0.22777395248413085, + "mean_token_accuracy": 0.9262309700250626, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38518730195802314, + "eval_loss": 0.6202630400657654, + "eval_mean_token_accuracy": 0.8493869807137999, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6616, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.3096018506214023, + "epoch": 4.428393524283935, + "grad_norm": 1.0448365211486816, + "learning_rate": 0.00015459186649280024, + "loss": 0.23696351051330566, + "mean_token_accuracy": 0.9217322513461113, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.3946371126140273, + "eval_loss": 0.6079026460647583, + "eval_mean_token_accuracy": 0.8492515852978063, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6582, + "eval_samples_per_second": 15.867, + "eval_steps_per_second": 1.985, + "step": 1780 + }, + { + "entropy": 0.32619857545942066, + "epoch": 4.478206724782067, + "grad_norm": 0.7210651636123657, + "learning_rate": 0.00015275749542482337, + "loss": 0.24651215076446534, + "mean_token_accuracy": 0.9177676141262054, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.3947690814560236, + "eval_loss": 0.6065912246704102, + "eval_mean_token_accuracy": 0.8502957744653835, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.5959, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.986, + "step": 1800 + }, + { + "entropy": 0.3193941755220294, + "epoch": 4.5280199252802, + "grad_norm": 0.8281906843185425, + "learning_rate": 0.0001509111761786888, + "loss": 0.23936262130737304, + "mean_token_accuracy": 0.9201708927750587, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38704028864239537, + "eval_loss": 0.6006569266319275, + "eval_mean_token_accuracy": 0.8502406720505205, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.8059, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1820 + }, + { + "entropy": 0.3164879363030195, + "epoch": 4.577833125778331, + "grad_norm": 0.7892968654632568, + "learning_rate": 0.00014905346557909867, + "loss": 0.24541733264923096, + "mean_token_accuracy": 0.9175932116806507, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.38861122120951497, + "eval_loss": 0.6115967631340027, + "eval_mean_token_accuracy": 0.849471275196519, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.2946, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1840 + }, + { + "entropy": 0.3051785985007882, + "epoch": 4.627646326276463, + "grad_norm": 0.8109654188156128, + "learning_rate": 0.0001471849238862319, + "loss": 0.23433220386505127, + "mean_token_accuracy": 0.9206570319831371, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.37162452295076015, + "eval_loss": 0.6184061765670776, + "eval_mean_token_accuracy": 0.8501173268223918, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.6865, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1860 + }, + { + "entropy": 0.3168198253959417, + "epoch": 4.677459526774595, + "grad_norm": 0.9512342214584351, + "learning_rate": 0.0001453061146267775, + "loss": 0.23832404613494873, + "mean_token_accuracy": 0.9197044663131237, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3845940856912801, + "eval_loss": 0.606762707233429, + "eval_mean_token_accuracy": 0.8504838194957999, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.5175, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 1880 + }, + { + "entropy": 0.30791807882487776, + "epoch": 4.7272727272727275, + "grad_norm": 0.8123113512992859, + "learning_rate": 0.00014341760442398248, + "loss": 0.2395785331726074, + "mean_token_accuracy": 0.918928150832653, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.39762327222283494, + "eval_loss": 0.5994202494621277, + "eval_mean_token_accuracy": 0.8509274201337681, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.2873, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.993, + "step": 1900 + }, + { + "entropy": 0.3021434534341097, + "epoch": 4.777085927770859, + "grad_norm": 0.731787383556366, + "learning_rate": 0.000141519962826766, + "loss": 0.23494718074798585, + "mean_token_accuracy": 0.9201403826475143, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.3827026732439219, + "eval_loss": 0.5995895862579346, + "eval_mean_token_accuracy": 0.851468373523202, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.3006, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 1920 + }, + { + "entropy": 0.31626159623265265, + "epoch": 4.826899128268991, + "grad_norm": 0.8848487138748169, + "learning_rate": 0.00013961376213795132, + "loss": 0.2439030647277832, + "mean_token_accuracy": 0.9196575872600079, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.388698436839636, + "eval_loss": 0.6000174283981323, + "eval_mean_token_accuracy": 0.8518068187458571, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.8979, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.979, + "step": 1940 + }, + { + "entropy": 0.30520407035946845, + "epoch": 4.876712328767123, + "grad_norm": 0.8532460927963257, + "learning_rate": 0.00013769957724166695, + "loss": 0.23458616733551024, + "mean_token_accuracy": 0.9221912942826748, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.38777847102908203, + "eval_loss": 0.6004981398582458, + "eval_mean_token_accuracy": 0.8516481768253238, + "eval_num_tokens": 4578167.0, + "eval_runtime": 87.0777, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.975, + "step": 1960 + }, + { + "entropy": 0.3226448342204094, + "epoch": 4.926525529265255, + "grad_norm": 0.6945561766624451, + "learning_rate": 0.0001357779854299694, + "loss": 0.24048397541046143, + "mean_token_accuracy": 0.9195300146937371, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.38581624263247777, + "eval_loss": 0.6029234528541565, + "eval_mean_token_accuracy": 0.8514213260523108, + "eval_num_tokens": 4622316.0, + "eval_runtime": 85.8729, + "eval_samples_per_second": 16.012, + "eval_steps_per_second": 2.003, + "step": 1980 + }, + { + "entropy": 0.3051655298098922, + "epoch": 4.976338729763388, + "grad_norm": 0.7976452708244324, + "learning_rate": 0.00013384956622874001, + "loss": 0.23584742546081544, + "mean_token_accuracy": 0.9216851457953453, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.37913159246361533, + "eval_loss": 0.6057604551315308, + "eval_mean_token_accuracy": 0.8525801203971686, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.1145, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 2000 + }, + { + "entropy": 0.27438195240803254, + "epoch": 5.024906600249066, + "grad_norm": 0.6729586124420166, + "learning_rate": 0.0001319149012229075, + "loss": 0.19775952100753785, + "mean_token_accuracy": 0.9339428559327737, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.3448961910813354, + "eval_loss": 0.6750120520591736, + "eval_mean_token_accuracy": 0.8487970232963562, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.1169, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 2020 + }, + { + "entropy": 0.21423916313797237, + "epoch": 5.074719800747198, + "grad_norm": 0.6934391856193542, + "learning_rate": 0.00012997457388105022, + "loss": 0.1439570426940918, + "mean_token_accuracy": 0.9528236843645572, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.3570949243771475, + "eval_loss": 0.6465504169464111, + "eval_mean_token_accuracy": 0.8490785547467166, + "eval_num_tokens": 4763269.0, + "eval_runtime": 85.9574, + "eval_samples_per_second": 15.996, + "eval_steps_per_second": 2.001, + "step": 2040 + }, + { + "entropy": 0.20838565267622472, + "epoch": 5.12453300124533, + "grad_norm": 0.7286986112594604, + "learning_rate": 0.00012802916937942972, + "loss": 0.14467307329177856, + "mean_token_accuracy": 0.950994835793972, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.3452463157821533, + "eval_loss": 0.6705958843231201, + "eval_mean_token_accuracy": 0.8490352796953778, + "eval_num_tokens": 4809047.0, + "eval_runtime": 86.228, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 2060 + }, + { + "entropy": 0.20453082229942082, + "epoch": 5.174346201743462, + "grad_norm": 0.7515555620193481, + "learning_rate": 0.00012607927442550974, + "loss": 0.13732000589370727, + "mean_token_accuracy": 0.9537357829511166, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.32431264914745506, + "eval_loss": 0.6743043065071106, + "eval_mean_token_accuracy": 0.8504878629085629, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.5948, + "eval_samples_per_second": 15.879, + "eval_steps_per_second": 1.986, + "step": 2080 + }, + { + "entropy": 0.21812320686876774, + "epoch": 5.224159402241594, + "grad_norm": 0.9093465209007263, + "learning_rate": 0.0001241254770810132, + "loss": 0.14311420917510986, + "mean_token_accuracy": 0.9514068141579628, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.33086285835435225, + "eval_loss": 0.6676449179649353, + "eval_mean_token_accuracy": 0.8505287662495015, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 2100 + }, + { + "entropy": 0.2180163251236081, + "epoch": 5.273972602739726, + "grad_norm": 0.6703007221221924, + "learning_rate": 0.00012216836658457075, + "loss": 0.14803968667984008, + "mean_token_accuracy": 0.9521303348243236, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.33162341708707255, + "eval_loss": 0.6658875942230225, + "eval_mean_token_accuracy": 0.8500757605530495, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.6296, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 2120 + }, + { + "entropy": 0.22511130161583423, + "epoch": 5.323785803237858, + "grad_norm": 0.8078880906105042, + "learning_rate": 0.00012020853317401455, + "loss": 0.15228408575057983, + "mean_token_accuracy": 0.947144789993763, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3354601170434508, + "eval_loss": 0.6677829623222351, + "eval_mean_token_accuracy": 0.8482600024273229, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.4689, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.989, + "step": 2140 + }, + { + "entropy": 0.2244176059961319, + "epoch": 5.37359900373599, + "grad_norm": 0.9636075496673584, + "learning_rate": 0.00011824656790837037, + "loss": 0.15260883569717407, + "mean_token_accuracy": 0.9471467643976211, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.3381616926297199, + "eval_loss": 0.6694412231445312, + "eval_mean_token_accuracy": 0.8482369603805764, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.4147, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 2160 + }, + { + "entropy": 0.22982364390045404, + "epoch": 5.423412204234122, + "grad_norm": 0.775401771068573, + "learning_rate": 0.00011628306248960262, + "loss": 0.15140302181243898, + "mean_token_accuracy": 0.9492553934454918, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.3305150235808173, + "eval_loss": 0.6717822551727295, + "eval_mean_token_accuracy": 0.8489849723355715, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.4728, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.989, + "step": 2180 + }, + { + "entropy": 0.21448935717344284, + "epoch": 5.473225404732254, + "grad_norm": 0.6575281023979187, + "learning_rate": 0.00011431860908416465, + "loss": 0.1452319622039795, + "mean_token_accuracy": 0.9505287684500218, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3488145174328671, + "eval_loss": 0.6612305641174316, + "eval_mean_token_accuracy": 0.8492907808963642, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6927, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 2200 + }, + { + "entropy": 0.23091202937066554, + "epoch": 5.523038605230386, + "grad_norm": 0.8909686207771301, + "learning_rate": 0.00011235380014440985, + "loss": 0.15150139331817628, + "mean_token_accuracy": 0.9497875183820724, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.3268539015810157, + "eval_loss": 0.6667542457580566, + "eval_mean_token_accuracy": 0.8499062903398691, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.4644, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 2220 + }, + { + "entropy": 0.2227974807843566, + "epoch": 5.572851805728518, + "grad_norm": 0.6180275082588196, + "learning_rate": 0.0001103892282299158, + "loss": 0.1491069197654724, + "mean_token_accuracy": 0.9488144010305405, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3346347655494546, + "eval_loss": 0.6665948629379272, + "eval_mean_token_accuracy": 0.8499961893918903, + "eval_num_tokens": 5226864.0, + "eval_runtime": 87.0548, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.976, + "step": 2240 + }, + { + "entropy": 0.21368421968072654, + "epoch": 5.62266500622665, + "grad_norm": 0.6004369258880615, + "learning_rate": 0.00010842548582877651, + "loss": 0.14485255479812623, + "mean_token_accuracy": 0.9502056457102299, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.32753298804163933, + "eval_loss": 0.6680151224136353, + "eval_mean_token_accuracy": 0.8515451086121936, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.8524, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.98, + "step": 2260 + }, + { + "entropy": 0.2103635374456644, + "epoch": 5.672478206724782, + "grad_norm": 0.699174702167511, + "learning_rate": 0.00010646316517891613, + "loss": 0.14297772645950318, + "mean_token_accuracy": 0.9512537539005279, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.32966585959806, + "eval_loss": 0.675578773021698, + "eval_mean_token_accuracy": 0.8509623023659684, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.4518, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.99, + "step": 2280 + }, + { + "entropy": 0.22516900151968003, + "epoch": 5.722291407222914, + "grad_norm": 0.6637354493141174, + "learning_rate": 0.00010450285808947797, + "loss": 0.15202572345733642, + "mean_token_accuracy": 0.9482452072203159, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3369456917740578, + "eval_loss": 0.6697061061859131, + "eval_mean_token_accuracy": 0.848603522361711, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.6371, + "eval_samples_per_second": 15.871, + "eval_steps_per_second": 1.985, + "step": 2300 + }, + { + "entropy": 0.21841065725311637, + "epoch": 5.772104607721046, + "grad_norm": 0.7940268516540527, + "learning_rate": 0.00010254515576234297, + "loss": 0.14710167646408082, + "mean_token_accuracy": 0.9493498183786869, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3237486180177955, + "eval_loss": 0.6779657602310181, + "eval_mean_token_accuracy": 0.8500715313955794, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.1826, + "eval_samples_per_second": 15.954, + "eval_steps_per_second": 1.996, + "step": 2320 + }, + { + "entropy": 0.22146204356104135, + "epoch": 5.821917808219178, + "grad_norm": 0.9234833121299744, + "learning_rate": 0.00010059064861383132, + "loss": 0.14720046520233154, + "mean_token_accuracy": 0.9493872679769992, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.32365207564692167, + "eval_loss": 0.6704005002975464, + "eval_mean_token_accuracy": 0.8507985760306203, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.5494, + "eval_samples_per_second": 15.887, + "eval_steps_per_second": 1.987, + "step": 2340 + }, + { + "entropy": 0.20934011954814197, + "epoch": 5.87173100871731, + "grad_norm": 0.5547503232955933, + "learning_rate": 9.863992609664084e-05, + "loss": 0.1464867353439331, + "mean_token_accuracy": 0.9503875687718392, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.3330401429083458, + "eval_loss": 0.6659091114997864, + "eval_mean_token_accuracy": 0.8504848906467127, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.5855, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 2360 + }, + { + "entropy": 0.21678635366261007, + "epoch": 5.921544209215442, + "grad_norm": 0.570612907409668, + "learning_rate": 9.669357652207635e-05, + "loss": 0.14821385145187377, + "mean_token_accuracy": 0.9503940217196941, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3322022325077722, + "eval_loss": 0.6722489595413208, + "eval_mean_token_accuracy": 0.8489979422369669, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.2986, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 2380 + }, + { + "entropy": 0.20932920072227718, + "epoch": 5.971357409713574, + "grad_norm": 0.7879557609558105, + "learning_rate": 9.475218688262262e-05, + "loss": 0.14675841331481934, + "mean_token_accuracy": 0.9507176131010056, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.3199348642902319, + "eval_loss": 0.6698136329650879, + "eval_mean_token_accuracy": 0.8514142130003419, + "eval_num_tokens": 5605400.0, + "eval_runtime": 85.8995, + "eval_samples_per_second": 16.007, + "eval_steps_per_second": 2.002, + "step": 2400 + }, + { + "entropy": 0.21032143919131693, + "epoch": 6.019925280199253, + "grad_norm": 0.5823076367378235, + "learning_rate": 9.281634267491569e-05, + "loss": 0.13322267532348633, + "mean_token_accuracy": 0.9550939072401096, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.30206270117399303, + "eval_loss": 0.7093168497085571, + "eval_mean_token_accuracy": 0.8500627639681794, + "eval_num_tokens": 5648968.0, + "eval_runtime": 85.8128, + "eval_samples_per_second": 16.023, + "eval_steps_per_second": 2.004, + "step": 2420 + }, + { + "entropy": 0.1534628233872354, + "epoch": 6.069738480697385, + "grad_norm": 0.710133969783783, + "learning_rate": 9.088662772316508e-05, + "loss": 0.09078952670097351, + "mean_token_accuracy": 0.9678447999060154, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.28208133101809857, + "eval_loss": 0.7636417150497437, + "eval_mean_token_accuracy": 0.8494061477655588, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9724, + "eval_samples_per_second": 15.994, + "eval_steps_per_second": 2.001, + "step": 2440 + }, + { + "entropy": 0.16151462448760867, + "epoch": 6.119551681195516, + "grad_norm": 0.5793812274932861, + "learning_rate": 8.896362400308028e-05, + "loss": 0.09545697569847107, + "mean_token_accuracy": 0.9671573750674725, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.2833245605403601, + "eval_loss": 0.7402405738830566, + "eval_mean_token_accuracy": 0.8503523728875226, + "eval_num_tokens": 5745090.0, + "eval_runtime": 85.5461, + "eval_samples_per_second": 16.073, + "eval_steps_per_second": 2.011, + "step": 2460 + }, + { + "entropy": 0.15203177919611335, + "epoch": 6.169364881693649, + "grad_norm": 0.4251123368740082, + "learning_rate": 8.704791146635483e-05, + "loss": 0.09420782327651978, + "mean_token_accuracy": 0.9677386932075024, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.28572545962971313, + "eval_loss": 0.735416829586029, + "eval_mean_token_accuracy": 0.8487084663884584, + "eval_num_tokens": 5790333.0, + "eval_runtime": 85.4801, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.012, + "step": 2480 + }, + { + "entropy": 0.15587336672469973, + "epoch": 6.219178082191781, + "grad_norm": 0.4357028007507324, + "learning_rate": 8.514006786576085e-05, + "loss": 0.09429320096969604, + "mean_token_accuracy": 0.9682952925562859, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.2859006894882335, + "eval_loss": 0.7347224950790405, + "eval_mean_token_accuracy": 0.8501905518215757, + "eval_num_tokens": 5837321.0, + "eval_runtime": 85.7578, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.006, + "step": 2500 + }, + { + "entropy": 0.15765639198943973, + "epoch": 6.268991282689913, + "grad_norm": 0.47331130504608154, + "learning_rate": 8.324066858090663e-05, + "loss": 0.09571113586425781, + "mean_token_accuracy": 0.9683481335639954, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.29231513846059176, + "eval_loss": 0.7392512559890747, + "eval_mean_token_accuracy": 0.8486633983462356, + "eval_num_tokens": 5884398.0, + "eval_runtime": 85.7846, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.005, + "step": 2520 + }, + { + "entropy": 0.16176860257983208, + "epoch": 6.318804483188045, + "grad_norm": 0.6142018437385559, + "learning_rate": 8.135028644470992e-05, + "loss": 0.09486144185066223, + "mean_token_accuracy": 0.9682316601276397, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.2851274753379267, + "eval_loss": 0.7520816922187805, + "eval_mean_token_accuracy": 0.8501113649717597, + "eval_num_tokens": 5929876.0, + "eval_runtime": 85.9425, + "eval_samples_per_second": 15.999, + "eval_steps_per_second": 2.001, + "step": 2540 + }, + { + "entropy": 0.15404034564271568, + "epoch": 6.3686176836861765, + "grad_norm": 0.6051287651062012, + "learning_rate": 7.946949157063964e-05, + "loss": 0.09280472993850708, + "mean_token_accuracy": 0.9684635892510414, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28802703563557114, + "eval_loss": 0.7439162135124207, + "eval_mean_token_accuracy": 0.8499851770872293, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.0703, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.998, + "step": 2560 + }, + { + "entropy": 0.15343588953837753, + "epoch": 6.418430884184309, + "grad_norm": 0.4823743402957916, + "learning_rate": 7.759885118077701e-05, + "loss": 0.09000591039657593, + "mean_token_accuracy": 0.9699928767979145, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2795634938533916, + "eval_loss": 0.7647850513458252, + "eval_mean_token_accuracy": 0.8503464397995971, + "eval_num_tokens": 6025380.0, + "eval_runtime": 85.8886, + "eval_samples_per_second": 16.009, + "eval_steps_per_second": 2.003, + "step": 2580 + }, + { + "entropy": 0.15740026142448188, + "epoch": 6.468244084682441, + "grad_norm": 0.5082696676254272, + "learning_rate": 7.57389294347494e-05, + "loss": 0.09191849827766418, + "mean_token_accuracy": 0.9692809768021107, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2913342311458532, + "eval_loss": 0.7518694996833801, + "eval_mean_token_accuracy": 0.8483168302580367, + "eval_num_tokens": 6073349.0, + "eval_runtime": 85.5761, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.01, + "step": 2600 + }, + { + "entropy": 0.15922069251537324, + "epoch": 6.518057285180573, + "grad_norm": 0.3995199501514435, + "learning_rate": 7.389028725958736e-05, + "loss": 0.09584367871284485, + "mean_token_accuracy": 0.9685114495456218, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.2863075934177221, + "eval_loss": 0.7539381384849548, + "eval_mean_token_accuracy": 0.8507507083027862, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.112, + "eval_samples_per_second": 15.968, + "eval_steps_per_second": 1.997, + "step": 2620 + }, + { + "entropy": 0.16197575423866512, + "epoch": 6.567870485678705, + "grad_norm": 0.534295380115509, + "learning_rate": 7.205348218055678e-05, + "loss": 0.0961170256137848, + "mean_token_accuracy": 0.9674530044198036, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.29021967315050057, + "eval_loss": 0.751198947429657, + "eval_mean_token_accuracy": 0.8509796344956686, + "eval_num_tokens": 6165523.0, + "eval_runtime": 85.7958, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.005, + "step": 2640 + }, + { + "entropy": 0.15261746793985367, + "epoch": 6.617683686176837, + "grad_norm": 0.5391237139701843, + "learning_rate": 7.022906815301673e-05, + "loss": 0.0926026999950409, + "mean_token_accuracy": 0.9695659473538398, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.29128045216202736, + "eval_loss": 0.7450292110443115, + "eval_mean_token_accuracy": 0.8498771443616512, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.3963, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 2660 + }, + { + "entropy": 0.16164180357009172, + "epoch": 6.667496886674969, + "grad_norm": 0.5767946243286133, + "learning_rate": 6.841759539535419e-05, + "loss": 0.09291981458663941, + "mean_token_accuracy": 0.9687136687338352, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2897637223088464, + "eval_loss": 0.7503410577774048, + "eval_mean_token_accuracy": 0.8503315164599308, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.0653, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.998, + "step": 2680 + }, + { + "entropy": 0.17062523355707526, + "epoch": 6.717310087173101, + "grad_norm": 0.4974168539047241, + "learning_rate": 6.661961022304563e-05, + "loss": 0.09713236689567566, + "mean_token_accuracy": 0.9661971725523472, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2765843396963075, + "eval_loss": 0.7604002356529236, + "eval_mean_token_accuracy": 0.8521115277395692, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.1676, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 2700 + }, + { + "entropy": 0.17544092936441302, + "epoch": 6.767123287671232, + "grad_norm": 0.5523537993431091, + "learning_rate": 6.483565488389582e-05, + "loss": 0.09709116220474243, + "mean_token_accuracy": 0.9650957375764847, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.27939334659035814, + "eval_loss": 0.7534670829772949, + "eval_mean_token_accuracy": 0.851230604010959, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.2913, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 2720 + }, + { + "entropy": 0.15991022661328316, + "epoch": 6.816936488169365, + "grad_norm": 0.478551983833313, + "learning_rate": 6.306626739450311e-05, + "loss": 0.09564646482467651, + "mean_token_accuracy": 0.9679084822535515, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.27878295491601146, + "eval_loss": 0.7519959211349487, + "eval_mean_token_accuracy": 0.8510654949864676, + "eval_num_tokens": 6397720.0, + "eval_runtime": 85.9109, + "eval_samples_per_second": 16.005, + "eval_steps_per_second": 2.002, + "step": 2740 + }, + { + "entropy": 0.16824879590421915, + "epoch": 6.866749688667497, + "grad_norm": 0.6681098937988281, + "learning_rate": 6.131198137800108e-05, + "loss": 0.0962279736995697, + "mean_token_accuracy": 0.966830012947321, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.2834690434121808, + "eval_loss": 0.751922070980072, + "eval_mean_token_accuracy": 0.8521237577809844, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.3618, + "eval_samples_per_second": 15.921, + "eval_steps_per_second": 1.992, + "step": 2760 + }, + { + "entropy": 0.1518704930320382, + "epoch": 6.916562889165629, + "grad_norm": 0.5201290249824524, + "learning_rate": 5.957332590312513e-05, + "loss": 0.09010660648345947, + "mean_token_accuracy": 0.9693463340401649, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.28485129617674404, + "eval_loss": 0.7452457547187805, + "eval_mean_token_accuracy": 0.8512036796919135, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.4524, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.99, + "step": 2780 + }, + { + "entropy": 0.15512610590085388, + "epoch": 6.966376089663761, + "grad_norm": 0.42802050709724426, + "learning_rate": 5.785082532465233e-05, + "loss": 0.09320432543754578, + "mean_token_accuracy": 0.9686134628951549, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.27554594526110693, + "eval_loss": 0.7644653916358948, + "eval_mean_token_accuracy": 0.8513738523389018, + "eval_num_tokens": 6540175.0, + "eval_runtime": 85.7609, + "eval_samples_per_second": 16.033, + "eval_steps_per_second": 2.006, + "step": 2800 + }, + { + "entropy": 0.17524497526196334, + "epoch": 7.01494396014944, + "grad_norm": 0.3330269157886505, + "learning_rate": 5.6144999125263545e-05, + "loss": 0.0895616888999939, + "mean_token_accuracy": 0.9682766932707566, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.2735865569218647, + "eval_loss": 0.768479585647583, + "eval_mean_token_accuracy": 0.8503459383581959, + "eval_num_tokens": 6583767.0, + "eval_runtime": 85.7162, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.007, + "step": 2820 + }, + { + "entropy": 0.1403565663844347, + "epoch": 7.064757160647572, + "grad_norm": 0.35613498091697693, + "learning_rate": 5.4456361758874235e-05, + "loss": 0.07551313638687134, + "mean_token_accuracy": 0.9739301167428493, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.25941789089593775, + "eval_loss": 0.8209511637687683, + "eval_mean_token_accuracy": 0.8505055855873019, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.0943, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 2840 + }, + { + "entropy": 0.13500106502324344, + "epoch": 7.114570361145703, + "grad_norm": 0.34418627619743347, + "learning_rate": 5.2785422495482234e-05, + "loss": 0.07293946146965027, + "mean_token_accuracy": 0.9747208289802074, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.26482899772912954, + "eval_loss": 0.798904538154602, + "eval_mean_token_accuracy": 0.8511530233677044, + "eval_num_tokens": 6672946.0, + "eval_runtime": 85.7915, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.005, + "step": 2860 + }, + { + "entropy": 0.13127502552233636, + "epoch": 7.164383561643835, + "grad_norm": 0.4638441503047943, + "learning_rate": 5.113268526757892e-05, + "loss": 0.07121461629867554, + "mean_token_accuracy": 0.9756786689162255, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2645381211714689, + "eval_loss": 0.809101939201355, + "eval_mean_token_accuracy": 0.8514727898115335, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.84, + "eval_samples_per_second": 16.018, + "eval_steps_per_second": 2.004, + "step": 2880 + }, + { + "entropy": 0.1331390908919275, + "epoch": 7.214196762141968, + "grad_norm": 0.40206775069236755, + "learning_rate": 4.949864851817007e-05, + "loss": 0.07188264131546021, + "mean_token_accuracy": 0.9755406074225903, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.26244733283339544, + "eval_loss": 0.8143188953399658, + "eval_mean_token_accuracy": 0.8514358189909957, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.8546, + "eval_samples_per_second": 16.015, + "eval_steps_per_second": 2.003, + "step": 2900 + }, + { + "entropy": 0.13647331558167936, + "epoch": 7.2640099626401, + "grad_norm": 0.26405787467956543, + "learning_rate": 4.788380505045224e-05, + "loss": 0.07412450313568116, + "mean_token_accuracy": 0.9744274213910102, + "num_tokens": 6809678.0, + "step": 2920 + }, + { + "epoch": 7.2640099626401, + "eval_entropy": 0.2626111418182074, + "eval_loss": 0.8111525177955627, + "eval_mean_token_accuracy": 0.8512121695418691, + "eval_num_tokens": 6809678.0, + "eval_runtime": 85.9626, + "eval_samples_per_second": 15.995, + "eval_steps_per_second": 2.001, + "step": 2920 + }, + { + "entropy": 0.12644002586603165, + "epoch": 7.313823163138232, + "grad_norm": 0.27514681220054626, + "learning_rate": 4.6288641879189884e-05, + "loss": 0.06807711124420165, + "mean_token_accuracy": 0.9760703906416893, + "num_tokens": 6860750.0, + "step": 2940 + }, + { + "epoch": 7.313823163138232, + "eval_entropy": 0.26096762734097106, + "eval_loss": 0.8184595108032227, + "eval_mean_token_accuracy": 0.8501476153384807, + "eval_num_tokens": 6860750.0, + "eval_runtime": 85.9521, + "eval_samples_per_second": 15.997, + "eval_steps_per_second": 2.001, + "step": 2940 + }, + { + "entropy": 0.13920630998909472, + "epoch": 7.363636363636363, + "grad_norm": 0.23584705591201782, + "learning_rate": 4.4713640083838604e-05, + "loss": 0.07301607131958007, + "mean_token_accuracy": 0.9745715200901032, + "num_tokens": 6907092.0, + "step": 2960 + }, + { + "epoch": 7.363636363636363, + "eval_entropy": 0.2612536767021168, + "eval_loss": 0.8116245269775391, + "eval_mean_token_accuracy": 0.8510967350976412, + "eval_num_tokens": 6907092.0, + "eval_runtime": 85.6373, + "eval_samples_per_second": 16.056, + "eval_steps_per_second": 2.008, + "step": 2960 + }, + { + "entropy": 0.1349492883309722, + "epoch": 7.4134495641344955, + "grad_norm": 0.24552719295024872, + "learning_rate": 4.315927466345791e-05, + "loss": 0.07397544980049134, + "mean_token_accuracy": 0.9745095103979111, + "num_tokens": 6952700.0, + "step": 2980 + }, + { + "epoch": 7.4134495641344955, + "eval_entropy": 0.25796533306670744, + "eval_loss": 0.8266491293907166, + "eval_mean_token_accuracy": 0.8511653857868772, + "eval_num_tokens": 6952700.0, + "eval_runtime": 85.7462, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.006, + "step": 2980 + }, + { + "entropy": 0.14479175000451505, + "epoch": 7.463262764632628, + "grad_norm": 0.2846072018146515, + "learning_rate": 4.162601439345814e-05, + "loss": 0.07544798254966736, + "mean_token_accuracy": 0.9727819666266442, + "num_tokens": 6996430.0, + "step": 3000 + }, + { + "epoch": 7.463262764632628, + "eval_entropy": 0.2584348309698493, + "eval_loss": 0.8253348469734192, + "eval_mean_token_accuracy": 0.8511569815319638, + "eval_num_tokens": 6996430.0, + "eval_runtime": 86.2984, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 3000 + }, + { + "entropy": 0.14114196319133043, + "epoch": 7.51307596513076, + "grad_norm": 0.407966285943985, + "learning_rate": 4.011432168422419e-05, + "loss": 0.0736398994922638, + "mean_token_accuracy": 0.9741654269397259, + "num_tokens": 7042038.0, + "step": 3020 + }, + { + "epoch": 7.51307596513076, + "eval_entropy": 0.25232676260693127, + "eval_loss": 0.8296052813529968, + "eval_mean_token_accuracy": 0.8523298349491385, + "eval_num_tokens": 7042038.0, + "eval_runtime": 85.8445, + "eval_samples_per_second": 16.017, + "eval_steps_per_second": 2.004, + "step": 3020 + }, + { + "entropy": 0.1353456223383546, + "epoch": 7.562889165628892, + "grad_norm": 0.2712634801864624, + "learning_rate": 3.8624652441658684e-05, + "loss": 0.07362412214279175, + "mean_token_accuracy": 0.9747945807874203, + "num_tokens": 7089390.0, + "step": 3040 + }, + { + "epoch": 7.562889165628892, + "eval_entropy": 0.2579477243991785, + "eval_loss": 0.8274564743041992, + "eval_mean_token_accuracy": 0.8517705212498821, + "eval_num_tokens": 7089390.0, + "eval_runtime": 85.8222, + "eval_samples_per_second": 16.022, + "eval_steps_per_second": 2.004, + "step": 3040 + }, + { + "entropy": 0.1296080862637609, + "epoch": 7.6127023661270234, + "grad_norm": 0.2371893972158432, + "learning_rate": 3.715745592968707e-05, + "loss": 0.06971035599708557, + "mean_token_accuracy": 0.9759043246507645, + "num_tokens": 7138002.0, + "step": 3060 + }, + { + "epoch": 7.6127023661270234, + "eval_entropy": 0.25391967083479083, + "eval_loss": 0.8197130560874939, + "eval_mean_token_accuracy": 0.8522267875283264, + "eval_num_tokens": 7138002.0, + "eval_runtime": 85.8796, + "eval_samples_per_second": 16.011, + "eval_steps_per_second": 2.003, + "step": 3060 + }, + { + "entropy": 0.1311203008517623, + "epoch": 7.662515566625156, + "grad_norm": 0.22499267756938934, + "learning_rate": 3.5713174634765967e-05, + "loss": 0.07176244258880615, + "mean_token_accuracy": 0.9754939571022987, + "num_tokens": 7185520.0, + "step": 3080 + }, + { + "epoch": 7.662515566625156, + "eval_entropy": 0.2526215241225653, + "eval_loss": 0.8265154361724854, + "eval_mean_token_accuracy": 0.8519952584837758, + "eval_num_tokens": 7185520.0, + "eval_runtime": 85.8746, + "eval_samples_per_second": 16.012, + "eval_steps_per_second": 2.003, + "step": 3080 + }, + { + "entropy": 0.13420484317466616, + "epoch": 7.712328767123288, + "grad_norm": 0.2398064285516739, + "learning_rate": 3.4292244132434866e-05, + "loss": 0.07559212446212768, + "mean_token_accuracy": 0.9743142127990723, + "num_tokens": 7232170.0, + "step": 3100 + }, + { + "epoch": 7.712328767123288, + "eval_entropy": 0.2484562756537005, + "eval_loss": 0.8312150239944458, + "eval_mean_token_accuracy": 0.8528405119513356, + "eval_num_tokens": 7232170.0, + "eval_runtime": 85.7896, + "eval_samples_per_second": 16.028, + "eval_steps_per_second": 2.005, + "step": 3100 + }, + { + "entropy": 0.11965563679113984, + "epoch": 7.76214196762142, + "grad_norm": 0.3408384919166565, + "learning_rate": 3.2895092955952746e-05, + "loss": 0.0661750853061676, + "mean_token_accuracy": 0.9776600524783134, + "num_tokens": 7282846.0, + "step": 3120 + }, + { + "epoch": 7.76214196762142, + "eval_entropy": 0.2522421533804993, + "eval_loss": 0.8327009677886963, + "eval_mean_token_accuracy": 0.8524222023958383, + "eval_num_tokens": 7282846.0, + "eval_runtime": 86.1769, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 1.996, + "step": 3120 + }, + { + "entropy": 0.13388084415346385, + "epoch": 7.811955168119551, + "grad_norm": 0.35418516397476196, + "learning_rate": 3.152214246705829e-05, + "loss": 0.07149899601936341, + "mean_token_accuracy": 0.9747635535895824, + "num_tokens": 7331518.0, + "step": 3140 + }, + { + "epoch": 7.811955168119551, + "eval_entropy": 0.25038352296795957, + "eval_loss": 0.836457371711731, + "eval_mean_token_accuracy": 0.8526130665180295, + "eval_num_tokens": 7331518.0, + "eval_runtime": 85.6099, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.009, + "step": 3140 + }, + { + "entropy": 0.13530643959529698, + "epoch": 7.861768368617684, + "grad_norm": 0.38060539960861206, + "learning_rate": 3.017380672889291e-05, + "loss": 0.07116585969924927, + "mean_token_accuracy": 0.973284512758255, + "num_tokens": 7379056.0, + "step": 3160 + }, + { + "epoch": 7.861768368617684, + "eval_entropy": 0.255092611319797, + "eval_loss": 0.8314701914787292, + "eval_mean_token_accuracy": 0.8520913099826768, + "eval_num_tokens": 7379056.0, + "eval_runtime": 85.877, + "eval_samples_per_second": 16.011, + "eval_steps_per_second": 2.003, + "step": 3160 + }, + { + "entropy": 0.13383390177041293, + "epoch": 7.911581569115816, + "grad_norm": 0.3827536106109619, + "learning_rate": 2.8850492381124808e-05, + "loss": 0.07305437326431274, + "mean_token_accuracy": 0.9750778004527092, + "num_tokens": 7424770.0, + "step": 3180 + }, + { + "epoch": 7.911581569115816, + "eval_entropy": 0.25416371157003004, + "eval_loss": 0.8206402063369751, + "eval_mean_token_accuracy": 0.852779901651449, + "eval_num_tokens": 7424770.0, + "eval_runtime": 86.1015, + "eval_samples_per_second": 15.97, + "eval_steps_per_second": 1.998, + "step": 3180 + }, + { + "entropy": 0.1395680439658463, + "epoch": 7.961394769613948, + "grad_norm": 0.3809775412082672, + "learning_rate": 2.7552598517312256e-05, + "loss": 0.07236042022705078, + "mean_token_accuracy": 0.9731538116931915, + "num_tokens": 7470804.0, + "step": 3200 + }, + { + "epoch": 7.961394769613948, + "eval_entropy": 0.25528111975899964, + "eval_loss": 0.8230037093162537, + "eval_mean_token_accuracy": 0.8526452603035195, + "eval_num_tokens": 7470804.0, + "eval_runtime": 85.7895, + "eval_samples_per_second": 16.028, + "eval_steps_per_second": 2.005, + "step": 3200 + }, + { + "entropy": 0.12193699864049752, + "epoch": 8.009962640099626, + "grad_norm": 0.11854425817728043, + "learning_rate": 2.6280516564542205e-05, + "loss": 0.06617764234542847, + "mean_token_accuracy": 0.977179691577569, + "num_tokens": 7518110.0, + "step": 3220 + }, + { + "epoch": 8.009962640099626, + "eval_entropy": 0.25100527677771656, + "eval_loss": 0.8393343687057495, + "eval_mean_token_accuracy": 0.8522553132023922, + "eval_num_tokens": 7518110.0, + "eval_runtime": 85.8837, + "eval_samples_per_second": 16.01, + "eval_steps_per_second": 2.003, + "step": 3220 + }, + { + "entropy": 0.12788885813206435, + "epoch": 8.059775840597759, + "grad_norm": 0.16094881296157837, + "learning_rate": 2.50346301653812e-05, + "loss": 0.06274186968803405, + "mean_token_accuracy": 0.9766994707286358, + "num_tokens": 7565539.0, + "step": 3240 + }, + { + "epoch": 8.059775840597759, + "eval_entropy": 0.24409458682287571, + "eval_loss": 0.874617338180542, + "eval_mean_token_accuracy": 0.8521041180505309, + "eval_num_tokens": 7565539.0, + "eval_runtime": 86.2656, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 3240 + }, + { + "entropy": 0.12464155335910618, + "epoch": 8.10958904109589, + "grad_norm": 0.16893954575061798, + "learning_rate": 2.381531506217437e-05, + "loss": 0.06093020439147949, + "mean_token_accuracy": 0.9776258453726768, + "num_tokens": 7612578.0, + "step": 3260 + }, + { + "epoch": 8.10958904109589, + "eval_entropy": 0.24396493017326953, + "eval_loss": 0.891161322593689, + "eval_mean_token_accuracy": 0.8515338024427724, + "eval_num_tokens": 7612578.0, + "eval_runtime": 85.9061, + "eval_samples_per_second": 16.006, + "eval_steps_per_second": 2.002, + "step": 3260 + }, + { + "entropy": 0.12345920228399336, + "epoch": 8.159402241594023, + "grad_norm": 0.14332273602485657, + "learning_rate": 2.262293898372616e-05, + "loss": 0.061289966106414795, + "mean_token_accuracy": 0.9762230902910233, + "num_tokens": 7660157.0, + "step": 3280 + }, + { + "epoch": 8.159402241594023, + "eval_entropy": 0.2481445314059424, + "eval_loss": 0.8922848105430603, + "eval_mean_token_accuracy": 0.8514944855556932, + "eval_num_tokens": 7660157.0, + "eval_runtime": 85.5201, + "eval_samples_per_second": 16.078, + "eval_steps_per_second": 2.011, + "step": 3280 + }, + { + "entropy": 0.12298110066913068, + "epoch": 8.209215442092155, + "grad_norm": 0.21848882734775543, + "learning_rate": 2.1457861534398633e-05, + "loss": 0.05986443758010864, + "mean_token_accuracy": 0.9786281704902648, + "num_tokens": 7709745.0, + "step": 3300 + }, + { + "epoch": 8.209215442092155, + "eval_entropy": 0.24329388124305149, + "eval_loss": 0.9021085500717163, + "eval_mean_token_accuracy": 0.8521762625422589, + "eval_num_tokens": 7709745.0, + "eval_runtime": 85.955, + "eval_samples_per_second": 15.997, + "eval_steps_per_second": 2.001, + "step": 3300 + }, + { + "entropy": 0.13265180448070168, + "epoch": 8.259028642590286, + "grad_norm": 0.18067947030067444, + "learning_rate": 2.0320434085659692e-05, + "loss": 0.06724961400032044, + "mean_token_accuracy": 0.975098168104887, + "num_tokens": 7753571.0, + "step": 3320 + }, + { + "epoch": 8.259028642590286, + "eval_entropy": 0.2433211464694766, + "eval_loss": 0.9094350337982178, + "eval_mean_token_accuracy": 0.8520150094531304, + "eval_num_tokens": 7753571.0, + "eval_runtime": 85.7989, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.005, + "step": 3320 + }, + { + "entropy": 0.11949320202693343, + "epoch": 8.308841843088418, + "grad_norm": 0.17020289599895477, + "learning_rate": 1.9210999670114196e-05, + "loss": 0.0634455680847168, + "mean_token_accuracy": 0.9771294385194779, + "num_tokens": 7799310.0, + "step": 3340 + }, + { + "epoch": 8.308841843088418, + "eval_entropy": 0.24345201219237128, + "eval_loss": 0.9021793603897095, + "eval_mean_token_accuracy": 0.8520745697409607, + "eval_num_tokens": 7799310.0, + "eval_runtime": 86.0883, + "eval_samples_per_second": 15.972, + "eval_steps_per_second": 1.998, + "step": 3340 + }, + { + "entropy": 0.12065747743472457, + "epoch": 8.35865504358655, + "grad_norm": 0.16789060831069946, + "learning_rate": 1.8129892878049886e-05, + "loss": 0.061494195461273195, + "mean_token_accuracy": 0.9779584899544715, + "num_tokens": 7846447.0, + "step": 3360 + }, + { + "epoch": 8.35865504358655, + "eval_entropy": 0.24093415042342142, + "eval_loss": 0.9006755352020264, + "eval_mean_token_accuracy": 0.852174230786257, + "eval_num_tokens": 7846447.0, + "eval_runtime": 85.9011, + "eval_samples_per_second": 16.007, + "eval_steps_per_second": 2.002, + "step": 3360 + }, + { + "entropy": 0.13125578537583352, + "epoch": 8.408468244084682, + "grad_norm": 0.1662452220916748, + "learning_rate": 1.70774397565298e-05, + "loss": 0.06685600876808166, + "mean_token_accuracy": 0.9744067586958408, + "num_tokens": 7890283.0, + "step": 3380 + }, + { + "epoch": 8.408468244084682, + "eval_entropy": 0.24062153688350388, + "eval_loss": 0.9078915119171143, + "eval_mean_token_accuracy": 0.8523201647886011, + "eval_num_tokens": 7890283.0, + "eval_runtime": 86.0201, + "eval_samples_per_second": 15.985, + "eval_steps_per_second": 2.0, + "step": 3380 + }, + { + "entropy": 0.11986117120832204, + "epoch": 8.458281444582815, + "grad_norm": 0.19571948051452637, + "learning_rate": 1.6053957711060606e-05, + "loss": 0.06411095261573792, + "mean_token_accuracy": 0.9770627245306969, + "num_tokens": 7936518.0, + "step": 3400 + }, + { + "epoch": 8.458281444582815, + "eval_entropy": 0.24352820347561394, + "eval_loss": 0.9058943390846252, + "eval_mean_token_accuracy": 0.8519382792156797, + "eval_num_tokens": 7936518.0, + "eval_runtime": 85.966, + "eval_samples_per_second": 15.995, + "eval_steps_per_second": 2.001, + "step": 3400 + }, + { + "entropy": 0.12857897616922856, + "epoch": 8.508094645080947, + "grad_norm": 0.2609264850616455, + "learning_rate": 1.5059755409867613e-05, + "loss": 0.06473397612571716, + "mean_token_accuracy": 0.9764650195837021, + "num_tokens": 7981966.0, + "step": 3420 + }, + { + "epoch": 8.508094645080947, + "eval_entropy": 0.24032609000108962, + "eval_loss": 0.9077776074409485, + "eval_mean_token_accuracy": 0.8517829197090726, + "eval_num_tokens": 7981966.0, + "eval_runtime": 86.6059, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 3420 + }, + { + "entropy": 0.12348870886489749, + "epoch": 8.557907845579079, + "grad_norm": 0.19537609815597534, + "learning_rate": 1.409513269080473e-05, + "loss": 0.06481348872184753, + "mean_token_accuracy": 0.9769559659063816, + "num_tokens": 8028367.0, + "step": 3440 + }, + { + "epoch": 8.557907845579079, + "eval_entropy": 0.2404322574824788, + "eval_loss": 0.9057720899581909, + "eval_mean_token_accuracy": 0.8521037981953732, + "eval_num_tokens": 8028367.0, + "eval_runtime": 86.166, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.996, + "step": 3440 + }, + { + "entropy": 0.12040232736617326, + "epoch": 8.607721046077211, + "grad_norm": 0.3310582935810089, + "learning_rate": 1.3160380470927183e-05, + "loss": 0.06468871235847473, + "mean_token_accuracy": 0.9768650442361831, + "num_tokens": 8074934.0, + "step": 3460 + }, + { + "epoch": 8.607721046077211, + "eval_entropy": 0.24118655876711356, + "eval_loss": 0.9028318524360657, + "eval_mean_token_accuracy": 0.8521025340224422, + "eval_num_tokens": 8074934.0, + "eval_runtime": 85.3668, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.015, + "step": 3460 + }, + { + "entropy": 0.12328103906475008, + "epoch": 8.657534246575342, + "grad_norm": 0.12836167216300964, + "learning_rate": 1.2255780658755122e-05, + "loss": 0.06229386329650879, + "mean_token_accuracy": 0.9763277888298034, + "num_tokens": 8122775.0, + "step": 3480 + }, + { + "epoch": 8.657534246575342, + "eval_entropy": 0.24194598145956217, + "eval_loss": 0.9009329080581665, + "eval_mean_token_accuracy": 0.8521693289973015, + "eval_num_tokens": 8122775.0, + "eval_runtime": 85.9415, + "eval_samples_per_second": 15.999, + "eval_steps_per_second": 2.001, + "step": 3480 + }, + { + "entropy": 0.11321646976284683, + "epoch": 8.707347447073474, + "grad_norm": 0.15656894445419312, + "learning_rate": 1.1381606069253786e-05, + "loss": 0.05908188819885254, + "mean_token_accuracy": 0.9779504477977753, + "num_tokens": 8174307.0, + "step": 3500 + }, + { + "epoch": 8.707347447073474, + "eval_entropy": 0.24121542517528977, + "eval_loss": 0.9016091823577881, + "eval_mean_token_accuracy": 0.8521790667328724, + "eval_num_tokens": 8174307.0, + "eval_runtime": 85.7465, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.006, + "step": 3500 + }, + { + "entropy": 0.12657046681270004, + "epoch": 8.757160647571606, + "grad_norm": 0.22597502171993256, + "learning_rate": 1.053812034155629e-05, + "loss": 0.06244581937789917, + "mean_token_accuracy": 0.976795207709074, + "num_tokens": 8222808.0, + "step": 3520 + }, + { + "epoch": 8.757160647571606, + "eval_entropy": 0.23877542708502258, + "eval_loss": 0.9069110155105591, + "eval_mean_token_accuracy": 0.8522880177858264, + "eval_num_tokens": 8222808.0, + "eval_runtime": 85.7792, + "eval_samples_per_second": 16.03, + "eval_steps_per_second": 2.005, + "step": 3520 + }, + { + "entropy": 0.11422101808711886, + "epoch": 8.806973848069738, + "grad_norm": 0.21139323711395264, + "learning_rate": 9.725577859453502e-06, + "loss": 0.05988085865974426, + "mean_token_accuracy": 0.9779510758817196, + "num_tokens": 8273335.0, + "step": 3540 + }, + { + "epoch": 8.806973848069738, + "eval_entropy": 0.2393161087881687, + "eval_loss": 0.9033801555633545, + "eval_mean_token_accuracy": 0.8522614209457885, + "eval_num_tokens": 8273335.0, + "eval_runtime": 85.5594, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 3540 + }, + { + "entropy": 0.13810604228638113, + "epoch": 8.85678704856787, + "grad_norm": 0.24571993947029114, + "learning_rate": 8.944223674675537e-06, + "loss": 0.07036117911338806, + "mean_token_accuracy": 0.9734892748296261, + "num_tokens": 8315235.0, + "step": 3560 + }, + { + "epoch": 8.85678704856787, + "eval_entropy": 0.23998506947658782, + "eval_loss": 0.9009848833084106, + "eval_mean_token_accuracy": 0.8521793619837872, + "eval_num_tokens": 8315235.0, + "eval_runtime": 86.0974, + "eval_samples_per_second": 15.97, + "eval_steps_per_second": 1.998, + "step": 3560 + }, + { + "entropy": 0.14193559321574867, + "epoch": 8.906600249066003, + "grad_norm": 0.17304112017154694, + "learning_rate": 8.194293432987386e-06, + "loss": 0.07077967524528503, + "mean_token_accuracy": 0.973305893689394, + "num_tokens": 8358099.0, + "step": 3580 + }, + { + "epoch": 8.906600249066003, + "eval_entropy": 0.23883876689644748, + "eval_loss": 0.9015622138977051, + "eval_mean_token_accuracy": 0.8524864378363587, + "eval_num_tokens": 8358099.0, + "eval_runtime": 86.0089, + "eval_samples_per_second": 15.987, + "eval_steps_per_second": 2.0, + "step": 3580 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.527526633737134e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-360/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-360/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-360/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-360/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-360/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-360/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-360/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-360/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-360/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-360/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-360/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-360/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-360/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-360/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..f0db24247f8c8234f2fe3786eb5c30cc503e3b1b --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-360/trainer_state.json @@ -0,0 +1,412 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 0.8966376089663761, + "eval_steps": 20, + "global_step": 360, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.5892743817486336e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3600/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3600/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3600/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3600/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3600/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3600/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3600/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3600/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3600/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3600/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3600/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3600/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3600/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3600/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..517815cb4b55e0e5f06c8ed6dff8a6232cf4242c --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3600/trainer_state.json @@ -0,0 +1,3814 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 8.956413449564135, + "eval_steps": 20, + "global_step": 3600, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + }, + { + "entropy": 0.561330484598875, + "epoch": 1.891656288916563, + "grad_norm": 0.6722865700721741, + "learning_rate": 0.0002208867897174789, + "loss": 0.499837589263916, + "mean_token_accuracy": 0.8518734864890576, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.5865232653396074, + "eval_loss": 0.5437926650047302, + "eval_mean_token_accuracy": 0.8450997017843779, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4116, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.547389242425561, + "epoch": 1.9414694894146949, + "grad_norm": 0.7935577034950256, + "learning_rate": 0.00022027119820226907, + "loss": 0.4977591514587402, + "mean_token_accuracy": 0.8539491161704064, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.5290903090391048, + "eval_loss": 0.5409526824951172, + "eval_mean_token_accuracy": 0.8497545698354411, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.7262, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 780 + }, + { + "entropy": 0.5687909748405218, + "epoch": 1.9912826899128269, + "grad_norm": 0.6180546283721924, + "learning_rate": 0.00021962329729698345, + "loss": 0.5109643459320068, + "mean_token_accuracy": 0.8521598495543004, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.5503541858390321, + "eval_loss": 0.5361555218696594, + "eval_mean_token_accuracy": 0.8510884285666221, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.3339, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 800 + }, + { + "entropy": 0.4739728841261986, + "epoch": 2.0398505603985058, + "grad_norm": 0.8058829307556152, + "learning_rate": 0.0002189432823996982, + "loss": 0.4204097747802734, + "mean_token_accuracy": 0.8728981889211215, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.5077334992414297, + "eval_loss": 0.5531114339828491, + "eval_mean_token_accuracy": 0.8489257208136625, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.4801, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.989, + "step": 820 + }, + { + "entropy": 0.4594309840351343, + "epoch": 2.0896637608966375, + "grad_norm": 0.6906896829605103, + "learning_rate": 0.0002182313585936314, + "loss": 0.4071959495544434, + "mean_token_accuracy": 0.8732857562601566, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.49850136994622474, + "eval_loss": 0.5486204624176025, + "eval_mean_token_accuracy": 0.8507991450470548, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.3364, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.4881629109382629, + "epoch": 2.1394769613947697, + "grad_norm": 0.6343470215797424, + "learning_rate": 0.0002174877405852928, + "loss": 0.41669540405273436, + "mean_token_accuracy": 0.8711295068264008, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.49155513924914734, + "eval_loss": 0.555109441280365, + "eval_mean_token_accuracy": 0.8496399400539176, + "eval_num_tokens": 2008562.0, + "eval_runtime": 86.3295, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 860 + }, + { + "entropy": 0.4648668970912695, + "epoch": 2.1892901618929015, + "grad_norm": 0.8014165163040161, + "learning_rate": 0.00021671265263973133, + "loss": 0.4110250473022461, + "mean_token_accuracy": 0.8754166305065155, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.4909258722219356, + "eval_loss": 0.5539511442184448, + "eval_mean_token_accuracy": 0.8492401502160138, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.3468, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 880 + }, + { + "entropy": 0.4824485514312983, + "epoch": 2.2391033623910337, + "grad_norm": 0.6665191054344177, + "learning_rate": 0.00021590632851289967, + "loss": 0.4181404113769531, + "mean_token_accuracy": 0.8726993151009083, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.4986876940657926, + "eval_loss": 0.547695517539978, + "eval_mean_token_accuracy": 0.8501384708770486, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.3838, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 900 + }, + { + "entropy": 0.4751896943897009, + "epoch": 2.2889165628891655, + "grad_norm": 0.81158047914505, + "learning_rate": 0.00021506901138115678, + "loss": 0.40689678192138673, + "mean_token_accuracy": 0.8745221219956875, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.507153491121392, + "eval_loss": 0.5501641631126404, + "eval_mean_token_accuracy": 0.8495670116918032, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.0912, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 920 + }, + { + "entropy": 0.4873133715242147, + "epoch": 2.3387297633872977, + "grad_norm": 0.7218056321144104, + "learning_rate": 0.0002142009537679292, + "loss": 0.42701358795166017, + "mean_token_accuracy": 0.8695114746689796, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5202612736543943, + "eval_loss": 0.5491839051246643, + "eval_mean_token_accuracy": 0.8494071208460386, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.1142, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 940 + }, + { + "entropy": 0.4762951169162989, + "epoch": 2.3885429638854294, + "grad_norm": 0.7194424867630005, + "learning_rate": 0.0002133024174675534, + "loss": 0.42299847602844237, + "mean_token_accuracy": 0.8709790132939815, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4899340462546016, + "eval_loss": 0.5522511601448059, + "eval_mean_token_accuracy": 0.8492208258357159, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.463, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 960 + }, + { + "entropy": 0.49650347977876663, + "epoch": 2.4383561643835616, + "grad_norm": 0.8406022787094116, + "learning_rate": 0.0002123736734663221, + "loss": 0.4275330066680908, + "mean_token_accuracy": 0.8670595556497573, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.49691385654515996, + "eval_loss": 0.5491269826889038, + "eval_mean_token_accuracy": 0.850309816210769, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.17, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 980 + }, + { + "entropy": 0.48843890577554705, + "epoch": 2.488169364881694, + "grad_norm": 0.9082473516464233, + "learning_rate": 0.00021141500186075868, + "loss": 0.4309722423553467, + "mean_token_accuracy": 0.8686766296625137, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5543508351195691, + "eval_loss": 0.5478800535202026, + "eval_mean_token_accuracy": 0.8478029522784921, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.3835, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 1000 + }, + { + "entropy": 0.4777219031006098, + "epoch": 2.5379825653798256, + "grad_norm": 0.7448089122772217, + "learning_rate": 0.0002104266917731438, + "loss": 0.423325252532959, + "mean_token_accuracy": 0.8706337086856365, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.49857561550168106, + "eval_loss": 0.5511948466300964, + "eval_mean_token_accuracy": 0.8502220289651737, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.5399, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.988, + "step": 1020 + }, + { + "entropy": 0.4844174191355705, + "epoch": 2.587795765877958, + "grad_norm": 0.794029176235199, + "learning_rate": 0.00020940904126432, + "loss": 0.4176753044128418, + "mean_token_accuracy": 0.873535567522049, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.485467542222766, + "eval_loss": 0.5539286732673645, + "eval_mean_token_accuracy": 0.8495475081510322, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.135, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 1.997, + "step": 1040 + }, + { + "entropy": 0.49070929251611234, + "epoch": 2.6376089663760895, + "grad_norm": 0.7558256983757019, + "learning_rate": 0.0002083623572438007, + "loss": 0.42867293357849123, + "mean_token_accuracy": 0.8696666076779366, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.490822730889154, + "eval_loss": 0.5434785485267639, + "eval_mean_token_accuracy": 0.850568296950917, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.4933, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 1060 + }, + { + "entropy": 0.47806114703416824, + "epoch": 2.6874221668742218, + "grad_norm": 0.6608979105949402, + "learning_rate": 0.00020728695537721047, + "loss": 0.4289727687835693, + "mean_token_accuracy": 0.8693130135536193, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.5285773256490397, + "eval_loss": 0.5444230437278748, + "eval_mean_token_accuracy": 0.8498796481032704, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.7091, + "eval_samples_per_second": 15.858, + "eval_steps_per_second": 1.984, + "step": 1080 + }, + { + "entropy": 0.5046216730028391, + "epoch": 2.7372353673723535, + "grad_norm": 0.8428544998168945, + "learning_rate": 0.00020618315999108454, + "loss": 0.43131070137023925, + "mean_token_accuracy": 0.8701941035687923, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.49888394738352576, + "eval_loss": 0.5459766387939453, + "eval_mean_token_accuracy": 0.8511758872935938, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.2222, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.995, + "step": 1100 + }, + { + "entropy": 0.5212558470666409, + "epoch": 2.7870485678704857, + "grad_norm": 1.129318118095398, + "learning_rate": 0.00020505130397505635, + "loss": 0.44249300956726073, + "mean_token_accuracy": 0.8654101334512234, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5179622324053631, + "eval_loss": 0.5522801280021667, + "eval_mean_token_accuracy": 0.8497019947268242, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.1903, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.996, + "step": 1120 + }, + { + "entropy": 0.4988406613469124, + "epoch": 2.8368617683686175, + "grad_norm": 0.6460545063018799, + "learning_rate": 0.00020389172868146263, + "loss": 0.4386270523071289, + "mean_token_accuracy": 0.8690383620560169, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.5042278484203094, + "eval_loss": 0.5433034300804138, + "eval_mean_token_accuracy": 0.8497674451317898, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.3028, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.993, + "step": 1140 + }, + { + "entropy": 0.4926559619605541, + "epoch": 2.8866749688667497, + "grad_norm": 0.8199329972267151, + "learning_rate": 0.00020270478382239615, + "loss": 0.4313485145568848, + "mean_token_accuracy": 0.8674727231264114, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.503873193160046, + "eval_loss": 0.5388111472129822, + "eval_mean_token_accuracy": 0.8526195034731266, + "eval_num_tokens": 2710196.0, + "eval_runtime": 86.4054, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.991, + "step": 1160 + }, + { + "entropy": 0.5020013231784105, + "epoch": 2.936488169364882, + "grad_norm": 0.7344821095466614, + "learning_rate": 0.00020149082736423723, + "loss": 0.43590536117553713, + "mean_token_accuracy": 0.8671772189438343, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5368241809828337, + "eval_loss": 0.5355703830718994, + "eval_mean_token_accuracy": 0.8517617773871089, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.2945, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1180 + }, + { + "entropy": 0.5112275708466768, + "epoch": 2.9863013698630136, + "grad_norm": 0.6951606869697571, + "learning_rate": 0.00020025022541969622, + "loss": 0.43579301834106443, + "mean_token_accuracy": 0.8641206480562686, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.5066795706055885, + "eval_loss": 0.5415249466896057, + "eval_mean_token_accuracy": 0.8493563373421513, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.5005, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.988, + "step": 1200 + }, + { + "entropy": 0.42298635305502474, + "epoch": 3.0348692403486925, + "grad_norm": 0.8201794028282166, + "learning_rate": 0.00019898335213739863, + "loss": 0.35593905448913576, + "mean_token_accuracy": 0.889238600547497, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.4584170470750609, + "eval_loss": 0.569487452507019, + "eval_mean_token_accuracy": 0.8495814173027526, + "eval_num_tokens": 2848509.0, + "eval_runtime": 86.2281, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 1220 + }, + { + "entropy": 0.37450140453875064, + "epoch": 3.0846824408468243, + "grad_norm": 0.7308394908905029, + "learning_rate": 0.0001976905895890471, + "loss": 0.307823920249939, + "mean_token_accuracy": 0.9001288741827012, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.45185995916294497, + "eval_loss": 0.5672881603240967, + "eval_mean_token_accuracy": 0.8511318519364955, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.0819, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.998, + "step": 1240 + }, + { + "entropy": 0.3887945845723152, + "epoch": 3.1344956413449565, + "grad_norm": 0.7299330830574036, + "learning_rate": 0.0001963723276541939, + "loss": 0.32047903537750244, + "mean_token_accuracy": 0.8960984498262405, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.44865354549053105, + "eval_loss": 0.5666037201881409, + "eval_mean_token_accuracy": 0.8496572649063066, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 1260 + }, + { + "entropy": 0.39677664265036583, + "epoch": 3.1843088418430883, + "grad_norm": 0.9533219933509827, + "learning_rate": 0.00019502896390265838, + "loss": 0.3253983497619629, + "mean_token_accuracy": 0.8964207418262958, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.4641980809527774, + "eval_loss": 0.5814996957778931, + "eval_mean_token_accuracy": 0.8485886212005171, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.7784, + "eval_samples_per_second": 15.845, + "eval_steps_per_second": 1.982, + "step": 1280 + }, + { + "entropy": 0.39210722744464876, + "epoch": 3.2341220423412205, + "grad_norm": 0.7447651028633118, + "learning_rate": 0.00019366090347462545, + "loss": 0.3276803970336914, + "mean_token_accuracy": 0.8930055953562259, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43595615254585135, + "eval_loss": 0.5722188353538513, + "eval_mean_token_accuracy": 0.8501105755567551, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.5271, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 1300 + }, + { + "entropy": 0.3684127271175385, + "epoch": 3.2839352428393527, + "grad_norm": 0.6934201121330261, + "learning_rate": 0.00019226855895846078, + "loss": 0.3156379222869873, + "mean_token_accuracy": 0.8976306475698947, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.4628148723480313, + "eval_loss": 0.5631352066993713, + "eval_mean_token_accuracy": 0.8504934813394103, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.3436, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 1320 + }, + { + "entropy": 0.4073401909321547, + "epoch": 3.3337484433374844, + "grad_norm": 0.9386897683143616, + "learning_rate": 0.00019085235026627994, + "loss": 0.34265310764312745, + "mean_token_accuracy": 0.8902062118053437, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.46455050623694133, + "eval_loss": 0.5586736798286438, + "eval_mean_token_accuracy": 0.8506874702004499, + "eval_num_tokens": 3132874.0, + "eval_runtime": 86.1286, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.997, + "step": 1340 + }, + { + "entropy": 0.4046429242938757, + "epoch": 3.383561643835616, + "grad_norm": 0.9633992314338684, + "learning_rate": 0.00018941270450730836, + "loss": 0.33816893100738527, + "mean_token_accuracy": 0.8927541889250279, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.46846531660750856, + "eval_loss": 0.561501681804657, + "eval_mean_token_accuracy": 0.8496256377114806, + "eval_num_tokens": 3178055.0, + "eval_runtime": 86.685, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1360 + }, + { + "entropy": 0.39872407019138334, + "epoch": 3.4333748443337484, + "grad_norm": 0.7786458730697632, + "learning_rate": 0.00018795005585907113, + "loss": 0.33342490196228025, + "mean_token_accuracy": 0.8944805048406124, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.42709505973860273, + "eval_loss": 0.5751848220825195, + "eval_mean_token_accuracy": 0.8507290447867194, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.6892, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 1380 + }, + { + "entropy": 0.3923338124528527, + "epoch": 3.4831880448318806, + "grad_norm": 0.9305956363677979, + "learning_rate": 0.0001864648454364511, + "loss": 0.33188116550445557, + "mean_token_accuracy": 0.8943330392241478, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.4386174779298694, + "eval_loss": 0.5680831074714661, + "eval_mean_token_accuracy": 0.8513129727784977, + "eval_num_tokens": 3274096.0, + "eval_runtime": 86.2671, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 1400 + }, + { + "entropy": 0.3856233984231949, + "epoch": 3.5330012453300124, + "grad_norm": 1.0362752676010132, + "learning_rate": 0.0001849575211586545, + "loss": 0.33098697662353516, + "mean_token_accuracy": 0.8961390435695649, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4574795474493226, + "eval_loss": 0.5630439519882202, + "eval_mean_token_accuracy": 0.8520988873964133, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.6035, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 1420 + }, + { + "entropy": 0.39812871962785723, + "epoch": 3.5828144458281446, + "grad_norm": 0.7807195782661438, + "learning_rate": 0.0001834285376141247, + "loss": 0.3333771228790283, + "mean_token_accuracy": 0.8930827379226685, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.4556825893909432, + "eval_loss": 0.5689062476158142, + "eval_mean_token_accuracy": 0.8507103507601937, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.1606, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.996, + "step": 1440 + }, + { + "entropy": 0.4147744856774807, + "epoch": 3.6326276463262763, + "grad_norm": 0.6429352164268494, + "learning_rate": 0.00018187835592344443, + "loss": 0.3482560873031616, + "mean_token_accuracy": 0.8910200245678425, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.46600024540757023, + "eval_loss": 0.5609709024429321, + "eval_mean_token_accuracy": 0.8491220876227977, + "eval_num_tokens": 3415600.0, + "eval_runtime": 86.8039, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1460 + }, + { + "entropy": 0.40425071083009245, + "epoch": 3.6824408468244085, + "grad_norm": 0.8613698482513428, + "learning_rate": 0.0001803074436002682, + "loss": 0.342916464805603, + "mean_token_accuracy": 0.8916418336331844, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.43855057899342026, + "eval_loss": 0.5720968246459961, + "eval_mean_token_accuracy": 0.8500823641932288, + "eval_num_tokens": 3460471.0, + "eval_runtime": 86.6746, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1480 + }, + { + "entropy": 0.39465143866837027, + "epoch": 3.7322540473225407, + "grad_norm": 0.6285189986228943, + "learning_rate": 0.0001787162744103265, + "loss": 0.3424591779708862, + "mean_token_accuracy": 0.8906558901071548, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4509461877304454, + "eval_loss": 0.5590082406997681, + "eval_mean_token_accuracy": 0.8511747371318729, + "eval_num_tokens": 3507647.0, + "eval_runtime": 86.8126, + "eval_samples_per_second": 15.839, + "eval_steps_per_second": 1.981, + "step": 1500 + }, + { + "entropy": 0.4021005939692259, + "epoch": 3.7820672478206725, + "grad_norm": 0.8821248412132263, + "learning_rate": 0.00017710532822854468, + "loss": 0.3462103843688965, + "mean_token_accuracy": 0.889109355956316, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.4502199075596277, + "eval_loss": 0.566046416759491, + "eval_mean_token_accuracy": 0.8501714208098345, + "eval_num_tokens": 3548934.0, + "eval_runtime": 86.8336, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.981, + "step": 1520 + }, + { + "entropy": 0.4017397932708263, + "epoch": 3.8318804483188043, + "grad_norm": 0.8400952816009521, + "learning_rate": 0.0001754750908943189, + "loss": 0.34890995025634763, + "mean_token_accuracy": 0.8892098367214203, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.4614003023435903, + "eval_loss": 0.5617933869361877, + "eval_mean_token_accuracy": 0.8515863616106122, + "eval_num_tokens": 3597186.0, + "eval_runtime": 86.4609, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 1540 + }, + { + "entropy": 0.4112051840871572, + "epoch": 3.8816936488169365, + "grad_norm": 0.769478440284729, + "learning_rate": 0.0001738260540649939, + "loss": 0.34711437225341796, + "mean_token_accuracy": 0.8911717928946018, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4540443811998811, + "eval_loss": 0.5576469898223877, + "eval_mean_token_accuracy": 0.8512079674144124, + "eval_num_tokens": 3646646.0, + "eval_runtime": 86.5103, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 1560 + }, + { + "entropy": 0.41105241514742374, + "epoch": 3.9315068493150687, + "grad_norm": 0.8468427062034607, + "learning_rate": 0.00017215871506758568, + "loss": 0.3433023452758789, + "mean_token_accuracy": 0.8898739732801915, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.4707539707075718, + "eval_loss": 0.5641466379165649, + "eval_mean_token_accuracy": 0.8495440957851188, + "eval_num_tokens": 3689560.0, + "eval_runtime": 86.609, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.986, + "step": 1580 + }, + { + "entropy": 0.41016379147768023, + "epoch": 3.9813200498132004, + "grad_norm": 0.7482675313949585, + "learning_rate": 0.0001704735767487946, + "loss": 0.34550890922546384, + "mean_token_accuracy": 0.8893028847873211, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.46391099864660307, + "eval_loss": 0.5593640804290771, + "eval_mean_token_accuracy": 0.8510130581467651, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.3975, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 1600 + }, + { + "entropy": 0.33167599791135544, + "epoch": 4.029887920298879, + "grad_norm": 0.9435692429542542, + "learning_rate": 0.00016877114732335337, + "loss": 0.2716026544570923, + "mean_token_accuracy": 0.9133149828666296, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.38499350005457567, + "eval_loss": 0.6298249363899231, + "eval_mean_token_accuracy": 0.8488117071778275, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.2933, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1620 + }, + { + "entropy": 0.3000166634097695, + "epoch": 4.0797011207970115, + "grad_norm": 0.8080845475196838, + "learning_rate": 0.0001670519402207569, + "loss": 0.22617182731628419, + "mean_token_accuracy": 0.9253474645316601, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.370110988703578, + "eval_loss": 0.6338461637496948, + "eval_mean_token_accuracy": 0.8485634801692741, + "eval_num_tokens": 3828830.0, + "eval_runtime": 85.9508, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.001, + "step": 1640 + }, + { + "entropy": 0.2986910421401262, + "epoch": 4.129514321295143, + "grad_norm": 0.7310900092124939, + "learning_rate": 0.0001653164739304185, + "loss": 0.22367463111877442, + "mean_token_accuracy": 0.9252275295555592, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.3944379702037157, + "eval_loss": 0.6109381914138794, + "eval_mean_token_accuracy": 0.849291454220927, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.6728, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1660 + }, + { + "entropy": 0.3095553796738386, + "epoch": 4.179327521793275, + "grad_norm": 0.7059140801429749, + "learning_rate": 0.0001635652718453007, + "loss": 0.23651680946350098, + "mean_token_accuracy": 0.9208931416273117, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.3910588648949945, + "eval_loss": 0.6104469299316406, + "eval_mean_token_accuracy": 0.8486883893262508, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7612, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.982, + "step": 1680 + }, + { + "entropy": 0.3001101028174162, + "epoch": 4.229140722291407, + "grad_norm": 0.6787802577018738, + "learning_rate": 0.00016179886210406728, + "loss": 0.23130471706390382, + "mean_token_accuracy": 0.9233332790434361, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3794369170832079, + "eval_loss": 0.6182110905647278, + "eval_mean_token_accuracy": 0.8495433777570724, + "eval_num_tokens": 3967474.0, + "eval_runtime": 85.94, + "eval_samples_per_second": 16.0, + "eval_steps_per_second": 2.001, + "step": 1700 + }, + { + "entropy": 0.3031421799212694, + "epoch": 4.2789539227895395, + "grad_norm": 0.9732038378715515, + "learning_rate": 0.0001600177774318036, + "loss": 0.2359529733657837, + "mean_token_accuracy": 0.9217648565769195, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3923123094231583, + "eval_loss": 0.6057384610176086, + "eval_mean_token_accuracy": 0.8508818288182103, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7647, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.29365369994193313, + "epoch": 4.328767123287671, + "grad_norm": 0.7681498527526855, + "learning_rate": 0.0001582225549793541, + "loss": 0.2269371747970581, + "mean_token_accuracy": 0.9245341829955578, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.4011661055129628, + "eval_loss": 0.6144486665725708, + "eval_mean_token_accuracy": 0.8480324357054955, + "eval_num_tokens": 4062594.0, + "eval_runtime": 87.1306, + "eval_samples_per_second": 15.781, + "eval_steps_per_second": 1.974, + "step": 1740 + }, + { + "entropy": 0.29396994728595016, + "epoch": 4.378580323785803, + "grad_norm": 1.0001007318496704, + "learning_rate": 0.0001564137361613248, + "loss": 0.22777395248413085, + "mean_token_accuracy": 0.9262309700250626, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38518730195802314, + "eval_loss": 0.6202630400657654, + "eval_mean_token_accuracy": 0.8493869807137999, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6616, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.3096018506214023, + "epoch": 4.428393524283935, + "grad_norm": 1.0448365211486816, + "learning_rate": 0.00015459186649280024, + "loss": 0.23696351051330566, + "mean_token_accuracy": 0.9217322513461113, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.3946371126140273, + "eval_loss": 0.6079026460647583, + "eval_mean_token_accuracy": 0.8492515852978063, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6582, + "eval_samples_per_second": 15.867, + "eval_steps_per_second": 1.985, + "step": 1780 + }, + { + "entropy": 0.32619857545942066, + "epoch": 4.478206724782067, + "grad_norm": 0.7210651636123657, + "learning_rate": 0.00015275749542482337, + "loss": 0.24651215076446534, + "mean_token_accuracy": 0.9177676141262054, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.3947690814560236, + "eval_loss": 0.6065912246704102, + "eval_mean_token_accuracy": 0.8502957744653835, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.5959, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.986, + "step": 1800 + }, + { + "entropy": 0.3193941755220294, + "epoch": 4.5280199252802, + "grad_norm": 0.8281906843185425, + "learning_rate": 0.0001509111761786888, + "loss": 0.23936262130737304, + "mean_token_accuracy": 0.9201708927750587, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38704028864239537, + "eval_loss": 0.6006569266319275, + "eval_mean_token_accuracy": 0.8502406720505205, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.8059, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1820 + }, + { + "entropy": 0.3164879363030195, + "epoch": 4.577833125778331, + "grad_norm": 0.7892968654632568, + "learning_rate": 0.00014905346557909867, + "loss": 0.24541733264923096, + "mean_token_accuracy": 0.9175932116806507, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.38861122120951497, + "eval_loss": 0.6115967631340027, + "eval_mean_token_accuracy": 0.849471275196519, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.2946, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1840 + }, + { + "entropy": 0.3051785985007882, + "epoch": 4.627646326276463, + "grad_norm": 0.8109654188156128, + "learning_rate": 0.0001471849238862319, + "loss": 0.23433220386505127, + "mean_token_accuracy": 0.9206570319831371, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.37162452295076015, + "eval_loss": 0.6184061765670776, + "eval_mean_token_accuracy": 0.8501173268223918, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.6865, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1860 + }, + { + "entropy": 0.3168198253959417, + "epoch": 4.677459526774595, + "grad_norm": 0.9512342214584351, + "learning_rate": 0.0001453061146267775, + "loss": 0.23832404613494873, + "mean_token_accuracy": 0.9197044663131237, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3845940856912801, + "eval_loss": 0.606762707233429, + "eval_mean_token_accuracy": 0.8504838194957999, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.5175, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 1880 + }, + { + "entropy": 0.30791807882487776, + "epoch": 4.7272727272727275, + "grad_norm": 0.8123113512992859, + "learning_rate": 0.00014341760442398248, + "loss": 0.2395785331726074, + "mean_token_accuracy": 0.918928150832653, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.39762327222283494, + "eval_loss": 0.5994202494621277, + "eval_mean_token_accuracy": 0.8509274201337681, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.2873, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.993, + "step": 1900 + }, + { + "entropy": 0.3021434534341097, + "epoch": 4.777085927770859, + "grad_norm": 0.731787383556366, + "learning_rate": 0.000141519962826766, + "loss": 0.23494718074798585, + "mean_token_accuracy": 0.9201403826475143, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.3827026732439219, + "eval_loss": 0.5995895862579346, + "eval_mean_token_accuracy": 0.851468373523202, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.3006, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 1920 + }, + { + "entropy": 0.31626159623265265, + "epoch": 4.826899128268991, + "grad_norm": 0.8848487138748169, + "learning_rate": 0.00013961376213795132, + "loss": 0.2439030647277832, + "mean_token_accuracy": 0.9196575872600079, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.388698436839636, + "eval_loss": 0.6000174283981323, + "eval_mean_token_accuracy": 0.8518068187458571, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.8979, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.979, + "step": 1940 + }, + { + "entropy": 0.30520407035946845, + "epoch": 4.876712328767123, + "grad_norm": 0.8532460927963257, + "learning_rate": 0.00013769957724166695, + "loss": 0.23458616733551024, + "mean_token_accuracy": 0.9221912942826748, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.38777847102908203, + "eval_loss": 0.6004981398582458, + "eval_mean_token_accuracy": 0.8516481768253238, + "eval_num_tokens": 4578167.0, + "eval_runtime": 87.0777, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.975, + "step": 1960 + }, + { + "entropy": 0.3226448342204094, + "epoch": 4.926525529265255, + "grad_norm": 0.6945561766624451, + "learning_rate": 0.0001357779854299694, + "loss": 0.24048397541046143, + "mean_token_accuracy": 0.9195300146937371, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.38581624263247777, + "eval_loss": 0.6029234528541565, + "eval_mean_token_accuracy": 0.8514213260523108, + "eval_num_tokens": 4622316.0, + "eval_runtime": 85.8729, + "eval_samples_per_second": 16.012, + "eval_steps_per_second": 2.003, + "step": 1980 + }, + { + "entropy": 0.3051655298098922, + "epoch": 4.976338729763388, + "grad_norm": 0.7976452708244324, + "learning_rate": 0.00013384956622874001, + "loss": 0.23584742546081544, + "mean_token_accuracy": 0.9216851457953453, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.37913159246361533, + "eval_loss": 0.6057604551315308, + "eval_mean_token_accuracy": 0.8525801203971686, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.1145, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 2000 + }, + { + "entropy": 0.27438195240803254, + "epoch": 5.024906600249066, + "grad_norm": 0.6729586124420166, + "learning_rate": 0.0001319149012229075, + "loss": 0.19775952100753785, + "mean_token_accuracy": 0.9339428559327737, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.3448961910813354, + "eval_loss": 0.6750120520591736, + "eval_mean_token_accuracy": 0.8487970232963562, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.1169, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 2020 + }, + { + "entropy": 0.21423916313797237, + "epoch": 5.074719800747198, + "grad_norm": 0.6934391856193542, + "learning_rate": 0.00012997457388105022, + "loss": 0.1439570426940918, + "mean_token_accuracy": 0.9528236843645572, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.3570949243771475, + "eval_loss": 0.6465504169464111, + "eval_mean_token_accuracy": 0.8490785547467166, + "eval_num_tokens": 4763269.0, + "eval_runtime": 85.9574, + "eval_samples_per_second": 15.996, + "eval_steps_per_second": 2.001, + "step": 2040 + }, + { + "entropy": 0.20838565267622472, + "epoch": 5.12453300124533, + "grad_norm": 0.7286986112594604, + "learning_rate": 0.00012802916937942972, + "loss": 0.14467307329177856, + "mean_token_accuracy": 0.950994835793972, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.3452463157821533, + "eval_loss": 0.6705958843231201, + "eval_mean_token_accuracy": 0.8490352796953778, + "eval_num_tokens": 4809047.0, + "eval_runtime": 86.228, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 2060 + }, + { + "entropy": 0.20453082229942082, + "epoch": 5.174346201743462, + "grad_norm": 0.7515555620193481, + "learning_rate": 0.00012607927442550974, + "loss": 0.13732000589370727, + "mean_token_accuracy": 0.9537357829511166, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.32431264914745506, + "eval_loss": 0.6743043065071106, + "eval_mean_token_accuracy": 0.8504878629085629, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.5948, + "eval_samples_per_second": 15.879, + "eval_steps_per_second": 1.986, + "step": 2080 + }, + { + "entropy": 0.21812320686876774, + "epoch": 5.224159402241594, + "grad_norm": 0.9093465209007263, + "learning_rate": 0.0001241254770810132, + "loss": 0.14311420917510986, + "mean_token_accuracy": 0.9514068141579628, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.33086285835435225, + "eval_loss": 0.6676449179649353, + "eval_mean_token_accuracy": 0.8505287662495015, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 2100 + }, + { + "entropy": 0.2180163251236081, + "epoch": 5.273972602739726, + "grad_norm": 0.6703007221221924, + "learning_rate": 0.00012216836658457075, + "loss": 0.14803968667984008, + "mean_token_accuracy": 0.9521303348243236, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.33162341708707255, + "eval_loss": 0.6658875942230225, + "eval_mean_token_accuracy": 0.8500757605530495, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.6296, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 2120 + }, + { + "entropy": 0.22511130161583423, + "epoch": 5.323785803237858, + "grad_norm": 0.8078880906105042, + "learning_rate": 0.00012020853317401455, + "loss": 0.15228408575057983, + "mean_token_accuracy": 0.947144789993763, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3354601170434508, + "eval_loss": 0.6677829623222351, + "eval_mean_token_accuracy": 0.8482600024273229, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.4689, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.989, + "step": 2140 + }, + { + "entropy": 0.2244176059961319, + "epoch": 5.37359900373599, + "grad_norm": 0.9636075496673584, + "learning_rate": 0.00011824656790837037, + "loss": 0.15260883569717407, + "mean_token_accuracy": 0.9471467643976211, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.3381616926297199, + "eval_loss": 0.6694412231445312, + "eval_mean_token_accuracy": 0.8482369603805764, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.4147, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 2160 + }, + { + "entropy": 0.22982364390045404, + "epoch": 5.423412204234122, + "grad_norm": 0.775401771068573, + "learning_rate": 0.00011628306248960262, + "loss": 0.15140302181243898, + "mean_token_accuracy": 0.9492553934454918, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.3305150235808173, + "eval_loss": 0.6717822551727295, + "eval_mean_token_accuracy": 0.8489849723355715, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.4728, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.989, + "step": 2180 + }, + { + "entropy": 0.21448935717344284, + "epoch": 5.473225404732254, + "grad_norm": 0.6575281023979187, + "learning_rate": 0.00011431860908416465, + "loss": 0.1452319622039795, + "mean_token_accuracy": 0.9505287684500218, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3488145174328671, + "eval_loss": 0.6612305641174316, + "eval_mean_token_accuracy": 0.8492907808963642, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6927, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 2200 + }, + { + "entropy": 0.23091202937066554, + "epoch": 5.523038605230386, + "grad_norm": 0.8909686207771301, + "learning_rate": 0.00011235380014440985, + "loss": 0.15150139331817628, + "mean_token_accuracy": 0.9497875183820724, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.3268539015810157, + "eval_loss": 0.6667542457580566, + "eval_mean_token_accuracy": 0.8499062903398691, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.4644, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 2220 + }, + { + "entropy": 0.2227974807843566, + "epoch": 5.572851805728518, + "grad_norm": 0.6180275082588196, + "learning_rate": 0.0001103892282299158, + "loss": 0.1491069197654724, + "mean_token_accuracy": 0.9488144010305405, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3346347655494546, + "eval_loss": 0.6665948629379272, + "eval_mean_token_accuracy": 0.8499961893918903, + "eval_num_tokens": 5226864.0, + "eval_runtime": 87.0548, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.976, + "step": 2240 + }, + { + "entropy": 0.21368421968072654, + "epoch": 5.62266500622665, + "grad_norm": 0.6004369258880615, + "learning_rate": 0.00010842548582877651, + "loss": 0.14485255479812623, + "mean_token_accuracy": 0.9502056457102299, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.32753298804163933, + "eval_loss": 0.6680151224136353, + "eval_mean_token_accuracy": 0.8515451086121936, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.8524, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.98, + "step": 2260 + }, + { + "entropy": 0.2103635374456644, + "epoch": 5.672478206724782, + "grad_norm": 0.699174702167511, + "learning_rate": 0.00010646316517891613, + "loss": 0.14297772645950318, + "mean_token_accuracy": 0.9512537539005279, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.32966585959806, + "eval_loss": 0.675578773021698, + "eval_mean_token_accuracy": 0.8509623023659684, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.4518, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.99, + "step": 2280 + }, + { + "entropy": 0.22516900151968003, + "epoch": 5.722291407222914, + "grad_norm": 0.6637354493141174, + "learning_rate": 0.00010450285808947797, + "loss": 0.15202572345733642, + "mean_token_accuracy": 0.9482452072203159, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3369456917740578, + "eval_loss": 0.6697061061859131, + "eval_mean_token_accuracy": 0.848603522361711, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.6371, + "eval_samples_per_second": 15.871, + "eval_steps_per_second": 1.985, + "step": 2300 + }, + { + "entropy": 0.21841065725311637, + "epoch": 5.772104607721046, + "grad_norm": 0.7940268516540527, + "learning_rate": 0.00010254515576234297, + "loss": 0.14710167646408082, + "mean_token_accuracy": 0.9493498183786869, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3237486180177955, + "eval_loss": 0.6779657602310181, + "eval_mean_token_accuracy": 0.8500715313955794, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.1826, + "eval_samples_per_second": 15.954, + "eval_steps_per_second": 1.996, + "step": 2320 + }, + { + "entropy": 0.22146204356104135, + "epoch": 5.821917808219178, + "grad_norm": 0.9234833121299744, + "learning_rate": 0.00010059064861383132, + "loss": 0.14720046520233154, + "mean_token_accuracy": 0.9493872679769992, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.32365207564692167, + "eval_loss": 0.6704005002975464, + "eval_mean_token_accuracy": 0.8507985760306203, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.5494, + "eval_samples_per_second": 15.887, + "eval_steps_per_second": 1.987, + "step": 2340 + }, + { + "entropy": 0.20934011954814197, + "epoch": 5.87173100871731, + "grad_norm": 0.5547503232955933, + "learning_rate": 9.863992609664084e-05, + "loss": 0.1464867353439331, + "mean_token_accuracy": 0.9503875687718392, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.3330401429083458, + "eval_loss": 0.6659091114997864, + "eval_mean_token_accuracy": 0.8504848906467127, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.5855, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 2360 + }, + { + "entropy": 0.21678635366261007, + "epoch": 5.921544209215442, + "grad_norm": 0.570612907409668, + "learning_rate": 9.669357652207635e-05, + "loss": 0.14821385145187377, + "mean_token_accuracy": 0.9503940217196941, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3322022325077722, + "eval_loss": 0.6722489595413208, + "eval_mean_token_accuracy": 0.8489979422369669, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.2986, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 2380 + }, + { + "entropy": 0.20932920072227718, + "epoch": 5.971357409713574, + "grad_norm": 0.7879557609558105, + "learning_rate": 9.475218688262262e-05, + "loss": 0.14675841331481934, + "mean_token_accuracy": 0.9507176131010056, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.3199348642902319, + "eval_loss": 0.6698136329650879, + "eval_mean_token_accuracy": 0.8514142130003419, + "eval_num_tokens": 5605400.0, + "eval_runtime": 85.8995, + "eval_samples_per_second": 16.007, + "eval_steps_per_second": 2.002, + "step": 2400 + }, + { + "entropy": 0.21032143919131693, + "epoch": 6.019925280199253, + "grad_norm": 0.5823076367378235, + "learning_rate": 9.281634267491569e-05, + "loss": 0.13322267532348633, + "mean_token_accuracy": 0.9550939072401096, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.30206270117399303, + "eval_loss": 0.7093168497085571, + "eval_mean_token_accuracy": 0.8500627639681794, + "eval_num_tokens": 5648968.0, + "eval_runtime": 85.8128, + "eval_samples_per_second": 16.023, + "eval_steps_per_second": 2.004, + "step": 2420 + }, + { + "entropy": 0.1534628233872354, + "epoch": 6.069738480697385, + "grad_norm": 0.710133969783783, + "learning_rate": 9.088662772316508e-05, + "loss": 0.09078952670097351, + "mean_token_accuracy": 0.9678447999060154, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.28208133101809857, + "eval_loss": 0.7636417150497437, + "eval_mean_token_accuracy": 0.8494061477655588, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9724, + "eval_samples_per_second": 15.994, + "eval_steps_per_second": 2.001, + "step": 2440 + }, + { + "entropy": 0.16151462448760867, + "epoch": 6.119551681195516, + "grad_norm": 0.5793812274932861, + "learning_rate": 8.896362400308028e-05, + "loss": 0.09545697569847107, + "mean_token_accuracy": 0.9671573750674725, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.2833245605403601, + "eval_loss": 0.7402405738830566, + "eval_mean_token_accuracy": 0.8503523728875226, + "eval_num_tokens": 5745090.0, + "eval_runtime": 85.5461, + "eval_samples_per_second": 16.073, + "eval_steps_per_second": 2.011, + "step": 2460 + }, + { + "entropy": 0.15203177919611335, + "epoch": 6.169364881693649, + "grad_norm": 0.4251123368740082, + "learning_rate": 8.704791146635483e-05, + "loss": 0.09420782327651978, + "mean_token_accuracy": 0.9677386932075024, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.28572545962971313, + "eval_loss": 0.735416829586029, + "eval_mean_token_accuracy": 0.8487084663884584, + "eval_num_tokens": 5790333.0, + "eval_runtime": 85.4801, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.012, + "step": 2480 + }, + { + "entropy": 0.15587336672469973, + "epoch": 6.219178082191781, + "grad_norm": 0.4357028007507324, + "learning_rate": 8.514006786576085e-05, + "loss": 0.09429320096969604, + "mean_token_accuracy": 0.9682952925562859, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.2859006894882335, + "eval_loss": 0.7347224950790405, + "eval_mean_token_accuracy": 0.8501905518215757, + "eval_num_tokens": 5837321.0, + "eval_runtime": 85.7578, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.006, + "step": 2500 + }, + { + "entropy": 0.15765639198943973, + "epoch": 6.268991282689913, + "grad_norm": 0.47331130504608154, + "learning_rate": 8.324066858090663e-05, + "loss": 0.09571113586425781, + "mean_token_accuracy": 0.9683481335639954, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.29231513846059176, + "eval_loss": 0.7392512559890747, + "eval_mean_token_accuracy": 0.8486633983462356, + "eval_num_tokens": 5884398.0, + "eval_runtime": 85.7846, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.005, + "step": 2520 + }, + { + "entropy": 0.16176860257983208, + "epoch": 6.318804483188045, + "grad_norm": 0.6142018437385559, + "learning_rate": 8.135028644470992e-05, + "loss": 0.09486144185066223, + "mean_token_accuracy": 0.9682316601276397, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.2851274753379267, + "eval_loss": 0.7520816922187805, + "eval_mean_token_accuracy": 0.8501113649717597, + "eval_num_tokens": 5929876.0, + "eval_runtime": 85.9425, + "eval_samples_per_second": 15.999, + "eval_steps_per_second": 2.001, + "step": 2540 + }, + { + "entropy": 0.15404034564271568, + "epoch": 6.3686176836861765, + "grad_norm": 0.6051287651062012, + "learning_rate": 7.946949157063964e-05, + "loss": 0.09280472993850708, + "mean_token_accuracy": 0.9684635892510414, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28802703563557114, + "eval_loss": 0.7439162135124207, + "eval_mean_token_accuracy": 0.8499851770872293, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.0703, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.998, + "step": 2560 + }, + { + "entropy": 0.15343588953837753, + "epoch": 6.418430884184309, + "grad_norm": 0.4823743402957916, + "learning_rate": 7.759885118077701e-05, + "loss": 0.09000591039657593, + "mean_token_accuracy": 0.9699928767979145, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2795634938533916, + "eval_loss": 0.7647850513458252, + "eval_mean_token_accuracy": 0.8503464397995971, + "eval_num_tokens": 6025380.0, + "eval_runtime": 85.8886, + "eval_samples_per_second": 16.009, + "eval_steps_per_second": 2.003, + "step": 2580 + }, + { + "entropy": 0.15740026142448188, + "epoch": 6.468244084682441, + "grad_norm": 0.5082696676254272, + "learning_rate": 7.57389294347494e-05, + "loss": 0.09191849827766418, + "mean_token_accuracy": 0.9692809768021107, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2913342311458532, + "eval_loss": 0.7518694996833801, + "eval_mean_token_accuracy": 0.8483168302580367, + "eval_num_tokens": 6073349.0, + "eval_runtime": 85.5761, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.01, + "step": 2600 + }, + { + "entropy": 0.15922069251537324, + "epoch": 6.518057285180573, + "grad_norm": 0.3995199501514435, + "learning_rate": 7.389028725958736e-05, + "loss": 0.09584367871284485, + "mean_token_accuracy": 0.9685114495456218, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.2863075934177221, + "eval_loss": 0.7539381384849548, + "eval_mean_token_accuracy": 0.8507507083027862, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.112, + "eval_samples_per_second": 15.968, + "eval_steps_per_second": 1.997, + "step": 2620 + }, + { + "entropy": 0.16197575423866512, + "epoch": 6.567870485678705, + "grad_norm": 0.534295380115509, + "learning_rate": 7.205348218055678e-05, + "loss": 0.0961170256137848, + "mean_token_accuracy": 0.9674530044198036, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.29021967315050057, + "eval_loss": 0.751198947429657, + "eval_mean_token_accuracy": 0.8509796344956686, + "eval_num_tokens": 6165523.0, + "eval_runtime": 85.7958, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.005, + "step": 2640 + }, + { + "entropy": 0.15261746793985367, + "epoch": 6.617683686176837, + "grad_norm": 0.5391237139701843, + "learning_rate": 7.022906815301673e-05, + "loss": 0.0926026999950409, + "mean_token_accuracy": 0.9695659473538398, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.29128045216202736, + "eval_loss": 0.7450292110443115, + "eval_mean_token_accuracy": 0.8498771443616512, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.3963, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 2660 + }, + { + "entropy": 0.16164180357009172, + "epoch": 6.667496886674969, + "grad_norm": 0.5767946243286133, + "learning_rate": 6.841759539535419e-05, + "loss": 0.09291981458663941, + "mean_token_accuracy": 0.9687136687338352, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2897637223088464, + "eval_loss": 0.7503410577774048, + "eval_mean_token_accuracy": 0.8503315164599308, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.0653, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.998, + "step": 2680 + }, + { + "entropy": 0.17062523355707526, + "epoch": 6.717310087173101, + "grad_norm": 0.4974168539047241, + "learning_rate": 6.661961022304563e-05, + "loss": 0.09713236689567566, + "mean_token_accuracy": 0.9661971725523472, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2765843396963075, + "eval_loss": 0.7604002356529236, + "eval_mean_token_accuracy": 0.8521115277395692, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.1676, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 2700 + }, + { + "entropy": 0.17544092936441302, + "epoch": 6.767123287671232, + "grad_norm": 0.5523537993431091, + "learning_rate": 6.483565488389582e-05, + "loss": 0.09709116220474243, + "mean_token_accuracy": 0.9650957375764847, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.27939334659035814, + "eval_loss": 0.7534670829772949, + "eval_mean_token_accuracy": 0.851230604010959, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.2913, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 2720 + }, + { + "entropy": 0.15991022661328316, + "epoch": 6.816936488169365, + "grad_norm": 0.478551983833313, + "learning_rate": 6.306626739450311e-05, + "loss": 0.09564646482467651, + "mean_token_accuracy": 0.9679084822535515, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.27878295491601146, + "eval_loss": 0.7519959211349487, + "eval_mean_token_accuracy": 0.8510654949864676, + "eval_num_tokens": 6397720.0, + "eval_runtime": 85.9109, + "eval_samples_per_second": 16.005, + "eval_steps_per_second": 2.002, + "step": 2740 + }, + { + "entropy": 0.16824879590421915, + "epoch": 6.866749688667497, + "grad_norm": 0.6681098937988281, + "learning_rate": 6.131198137800108e-05, + "loss": 0.0962279736995697, + "mean_token_accuracy": 0.966830012947321, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.2834690434121808, + "eval_loss": 0.751922070980072, + "eval_mean_token_accuracy": 0.8521237577809844, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.3618, + "eval_samples_per_second": 15.921, + "eval_steps_per_second": 1.992, + "step": 2760 + }, + { + "entropy": 0.1518704930320382, + "epoch": 6.916562889165629, + "grad_norm": 0.5201290249824524, + "learning_rate": 5.957332590312513e-05, + "loss": 0.09010660648345947, + "mean_token_accuracy": 0.9693463340401649, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.28485129617674404, + "eval_loss": 0.7452457547187805, + "eval_mean_token_accuracy": 0.8512036796919135, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.4524, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.99, + "step": 2780 + }, + { + "entropy": 0.15512610590085388, + "epoch": 6.966376089663761, + "grad_norm": 0.42802050709724426, + "learning_rate": 5.785082532465233e-05, + "loss": 0.09320432543754578, + "mean_token_accuracy": 0.9686134628951549, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.27554594526110693, + "eval_loss": 0.7644653916358948, + "eval_mean_token_accuracy": 0.8513738523389018, + "eval_num_tokens": 6540175.0, + "eval_runtime": 85.7609, + "eval_samples_per_second": 16.033, + "eval_steps_per_second": 2.006, + "step": 2800 + }, + { + "entropy": 0.17524497526196334, + "epoch": 7.01494396014944, + "grad_norm": 0.3330269157886505, + "learning_rate": 5.6144999125263545e-05, + "loss": 0.0895616888999939, + "mean_token_accuracy": 0.9682766932707566, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.2735865569218647, + "eval_loss": 0.768479585647583, + "eval_mean_token_accuracy": 0.8503459383581959, + "eval_num_tokens": 6583767.0, + "eval_runtime": 85.7162, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.007, + "step": 2820 + }, + { + "entropy": 0.1403565663844347, + "epoch": 7.064757160647572, + "grad_norm": 0.35613498091697693, + "learning_rate": 5.4456361758874235e-05, + "loss": 0.07551313638687134, + "mean_token_accuracy": 0.9739301167428493, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.25941789089593775, + "eval_loss": 0.8209511637687683, + "eval_mean_token_accuracy": 0.8505055855873019, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.0943, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 2840 + }, + { + "entropy": 0.13500106502324344, + "epoch": 7.114570361145703, + "grad_norm": 0.34418627619743347, + "learning_rate": 5.2785422495482234e-05, + "loss": 0.07293946146965027, + "mean_token_accuracy": 0.9747208289802074, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.26482899772912954, + "eval_loss": 0.798904538154602, + "eval_mean_token_accuracy": 0.8511530233677044, + "eval_num_tokens": 6672946.0, + "eval_runtime": 85.7915, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.005, + "step": 2860 + }, + { + "entropy": 0.13127502552233636, + "epoch": 7.164383561643835, + "grad_norm": 0.4638441503047943, + "learning_rate": 5.113268526757892e-05, + "loss": 0.07121461629867554, + "mean_token_accuracy": 0.9756786689162255, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2645381211714689, + "eval_loss": 0.809101939201355, + "eval_mean_token_accuracy": 0.8514727898115335, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.84, + "eval_samples_per_second": 16.018, + "eval_steps_per_second": 2.004, + "step": 2880 + }, + { + "entropy": 0.1331390908919275, + "epoch": 7.214196762141968, + "grad_norm": 0.40206775069236755, + "learning_rate": 4.949864851817007e-05, + "loss": 0.07188264131546021, + "mean_token_accuracy": 0.9755406074225903, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.26244733283339544, + "eval_loss": 0.8143188953399658, + "eval_mean_token_accuracy": 0.8514358189909957, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.8546, + "eval_samples_per_second": 16.015, + "eval_steps_per_second": 2.003, + "step": 2900 + }, + { + "entropy": 0.13647331558167936, + "epoch": 7.2640099626401, + "grad_norm": 0.26405787467956543, + "learning_rate": 4.788380505045224e-05, + "loss": 0.07412450313568116, + "mean_token_accuracy": 0.9744274213910102, + "num_tokens": 6809678.0, + "step": 2920 + }, + { + "epoch": 7.2640099626401, + "eval_entropy": 0.2626111418182074, + "eval_loss": 0.8111525177955627, + "eval_mean_token_accuracy": 0.8512121695418691, + "eval_num_tokens": 6809678.0, + "eval_runtime": 85.9626, + "eval_samples_per_second": 15.995, + "eval_steps_per_second": 2.001, + "step": 2920 + }, + { + "entropy": 0.12644002586603165, + "epoch": 7.313823163138232, + "grad_norm": 0.27514681220054626, + "learning_rate": 4.6288641879189884e-05, + "loss": 0.06807711124420165, + "mean_token_accuracy": 0.9760703906416893, + "num_tokens": 6860750.0, + "step": 2940 + }, + { + "epoch": 7.313823163138232, + "eval_entropy": 0.26096762734097106, + "eval_loss": 0.8184595108032227, + "eval_mean_token_accuracy": 0.8501476153384807, + "eval_num_tokens": 6860750.0, + "eval_runtime": 85.9521, + "eval_samples_per_second": 15.997, + "eval_steps_per_second": 2.001, + "step": 2940 + }, + { + "entropy": 0.13920630998909472, + "epoch": 7.363636363636363, + "grad_norm": 0.23584705591201782, + "learning_rate": 4.4713640083838604e-05, + "loss": 0.07301607131958007, + "mean_token_accuracy": 0.9745715200901032, + "num_tokens": 6907092.0, + "step": 2960 + }, + { + "epoch": 7.363636363636363, + "eval_entropy": 0.2612536767021168, + "eval_loss": 0.8116245269775391, + "eval_mean_token_accuracy": 0.8510967350976412, + "eval_num_tokens": 6907092.0, + "eval_runtime": 85.6373, + "eval_samples_per_second": 16.056, + "eval_steps_per_second": 2.008, + "step": 2960 + }, + { + "entropy": 0.1349492883309722, + "epoch": 7.4134495641344955, + "grad_norm": 0.24552719295024872, + "learning_rate": 4.315927466345791e-05, + "loss": 0.07397544980049134, + "mean_token_accuracy": 0.9745095103979111, + "num_tokens": 6952700.0, + "step": 2980 + }, + { + "epoch": 7.4134495641344955, + "eval_entropy": 0.25796533306670744, + "eval_loss": 0.8266491293907166, + "eval_mean_token_accuracy": 0.8511653857868772, + "eval_num_tokens": 6952700.0, + "eval_runtime": 85.7462, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.006, + "step": 2980 + }, + { + "entropy": 0.14479175000451505, + "epoch": 7.463262764632628, + "grad_norm": 0.2846072018146515, + "learning_rate": 4.162601439345814e-05, + "loss": 0.07544798254966736, + "mean_token_accuracy": 0.9727819666266442, + "num_tokens": 6996430.0, + "step": 3000 + }, + { + "epoch": 7.463262764632628, + "eval_entropy": 0.2584348309698493, + "eval_loss": 0.8253348469734192, + "eval_mean_token_accuracy": 0.8511569815319638, + "eval_num_tokens": 6996430.0, + "eval_runtime": 86.2984, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 3000 + }, + { + "entropy": 0.14114196319133043, + "epoch": 7.51307596513076, + "grad_norm": 0.407966285943985, + "learning_rate": 4.011432168422419e-05, + "loss": 0.0736398994922638, + "mean_token_accuracy": 0.9741654269397259, + "num_tokens": 7042038.0, + "step": 3020 + }, + { + "epoch": 7.51307596513076, + "eval_entropy": 0.25232676260693127, + "eval_loss": 0.8296052813529968, + "eval_mean_token_accuracy": 0.8523298349491385, + "eval_num_tokens": 7042038.0, + "eval_runtime": 85.8445, + "eval_samples_per_second": 16.017, + "eval_steps_per_second": 2.004, + "step": 3020 + }, + { + "entropy": 0.1353456223383546, + "epoch": 7.562889165628892, + "grad_norm": 0.2712634801864624, + "learning_rate": 3.8624652441658684e-05, + "loss": 0.07362412214279175, + "mean_token_accuracy": 0.9747945807874203, + "num_tokens": 7089390.0, + "step": 3040 + }, + { + "epoch": 7.562889165628892, + "eval_entropy": 0.2579477243991785, + "eval_loss": 0.8274564743041992, + "eval_mean_token_accuracy": 0.8517705212498821, + "eval_num_tokens": 7089390.0, + "eval_runtime": 85.8222, + "eval_samples_per_second": 16.022, + "eval_steps_per_second": 2.004, + "step": 3040 + }, + { + "entropy": 0.1296080862637609, + "epoch": 7.6127023661270234, + "grad_norm": 0.2371893972158432, + "learning_rate": 3.715745592968707e-05, + "loss": 0.06971035599708557, + "mean_token_accuracy": 0.9759043246507645, + "num_tokens": 7138002.0, + "step": 3060 + }, + { + "epoch": 7.6127023661270234, + "eval_entropy": 0.25391967083479083, + "eval_loss": 0.8197130560874939, + "eval_mean_token_accuracy": 0.8522267875283264, + "eval_num_tokens": 7138002.0, + "eval_runtime": 85.8796, + "eval_samples_per_second": 16.011, + "eval_steps_per_second": 2.003, + "step": 3060 + }, + { + "entropy": 0.1311203008517623, + "epoch": 7.662515566625156, + "grad_norm": 0.22499267756938934, + "learning_rate": 3.5713174634765967e-05, + "loss": 0.07176244258880615, + "mean_token_accuracy": 0.9754939571022987, + "num_tokens": 7185520.0, + "step": 3080 + }, + { + "epoch": 7.662515566625156, + "eval_entropy": 0.2526215241225653, + "eval_loss": 0.8265154361724854, + "eval_mean_token_accuracy": 0.8519952584837758, + "eval_num_tokens": 7185520.0, + "eval_runtime": 85.8746, + "eval_samples_per_second": 16.012, + "eval_steps_per_second": 2.003, + "step": 3080 + }, + { + "entropy": 0.13420484317466616, + "epoch": 7.712328767123288, + "grad_norm": 0.2398064285516739, + "learning_rate": 3.4292244132434866e-05, + "loss": 0.07559212446212768, + "mean_token_accuracy": 0.9743142127990723, + "num_tokens": 7232170.0, + "step": 3100 + }, + { + "epoch": 7.712328767123288, + "eval_entropy": 0.2484562756537005, + "eval_loss": 0.8312150239944458, + "eval_mean_token_accuracy": 0.8528405119513356, + "eval_num_tokens": 7232170.0, + "eval_runtime": 85.7896, + "eval_samples_per_second": 16.028, + "eval_steps_per_second": 2.005, + "step": 3100 + }, + { + "entropy": 0.11965563679113984, + "epoch": 7.76214196762142, + "grad_norm": 0.3408384919166565, + "learning_rate": 3.2895092955952746e-05, + "loss": 0.0661750853061676, + "mean_token_accuracy": 0.9776600524783134, + "num_tokens": 7282846.0, + "step": 3120 + }, + { + "epoch": 7.76214196762142, + "eval_entropy": 0.2522421533804993, + "eval_loss": 0.8327009677886963, + "eval_mean_token_accuracy": 0.8524222023958383, + "eval_num_tokens": 7282846.0, + "eval_runtime": 86.1769, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 1.996, + "step": 3120 + }, + { + "entropy": 0.13388084415346385, + "epoch": 7.811955168119551, + "grad_norm": 0.35418516397476196, + "learning_rate": 3.152214246705829e-05, + "loss": 0.07149899601936341, + "mean_token_accuracy": 0.9747635535895824, + "num_tokens": 7331518.0, + "step": 3140 + }, + { + "epoch": 7.811955168119551, + "eval_entropy": 0.25038352296795957, + "eval_loss": 0.836457371711731, + "eval_mean_token_accuracy": 0.8526130665180295, + "eval_num_tokens": 7331518.0, + "eval_runtime": 85.6099, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.009, + "step": 3140 + }, + { + "entropy": 0.13530643959529698, + "epoch": 7.861768368617684, + "grad_norm": 0.38060539960861206, + "learning_rate": 3.017380672889291e-05, + "loss": 0.07116585969924927, + "mean_token_accuracy": 0.973284512758255, + "num_tokens": 7379056.0, + "step": 3160 + }, + { + "epoch": 7.861768368617684, + "eval_entropy": 0.255092611319797, + "eval_loss": 0.8314701914787292, + "eval_mean_token_accuracy": 0.8520913099826768, + "eval_num_tokens": 7379056.0, + "eval_runtime": 85.877, + "eval_samples_per_second": 16.011, + "eval_steps_per_second": 2.003, + "step": 3160 + }, + { + "entropy": 0.13383390177041293, + "epoch": 7.911581569115816, + "grad_norm": 0.3827536106109619, + "learning_rate": 2.8850492381124808e-05, + "loss": 0.07305437326431274, + "mean_token_accuracy": 0.9750778004527092, + "num_tokens": 7424770.0, + "step": 3180 + }, + { + "epoch": 7.911581569115816, + "eval_entropy": 0.25416371157003004, + "eval_loss": 0.8206402063369751, + "eval_mean_token_accuracy": 0.852779901651449, + "eval_num_tokens": 7424770.0, + "eval_runtime": 86.1015, + "eval_samples_per_second": 15.97, + "eval_steps_per_second": 1.998, + "step": 3180 + }, + { + "entropy": 0.1395680439658463, + "epoch": 7.961394769613948, + "grad_norm": 0.3809775412082672, + "learning_rate": 2.7552598517312256e-05, + "loss": 0.07236042022705078, + "mean_token_accuracy": 0.9731538116931915, + "num_tokens": 7470804.0, + "step": 3200 + }, + { + "epoch": 7.961394769613948, + "eval_entropy": 0.25528111975899964, + "eval_loss": 0.8230037093162537, + "eval_mean_token_accuracy": 0.8526452603035195, + "eval_num_tokens": 7470804.0, + "eval_runtime": 85.7895, + "eval_samples_per_second": 16.028, + "eval_steps_per_second": 2.005, + "step": 3200 + }, + { + "entropy": 0.12193699864049752, + "epoch": 8.009962640099626, + "grad_norm": 0.11854425817728043, + "learning_rate": 2.6280516564542205e-05, + "loss": 0.06617764234542847, + "mean_token_accuracy": 0.977179691577569, + "num_tokens": 7518110.0, + "step": 3220 + }, + { + "epoch": 8.009962640099626, + "eval_entropy": 0.25100527677771656, + "eval_loss": 0.8393343687057495, + "eval_mean_token_accuracy": 0.8522553132023922, + "eval_num_tokens": 7518110.0, + "eval_runtime": 85.8837, + "eval_samples_per_second": 16.01, + "eval_steps_per_second": 2.003, + "step": 3220 + }, + { + "entropy": 0.12788885813206435, + "epoch": 8.059775840597759, + "grad_norm": 0.16094881296157837, + "learning_rate": 2.50346301653812e-05, + "loss": 0.06274186968803405, + "mean_token_accuracy": 0.9766994707286358, + "num_tokens": 7565539.0, + "step": 3240 + }, + { + "epoch": 8.059775840597759, + "eval_entropy": 0.24409458682287571, + "eval_loss": 0.874617338180542, + "eval_mean_token_accuracy": 0.8521041180505309, + "eval_num_tokens": 7565539.0, + "eval_runtime": 86.2656, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 3240 + }, + { + "entropy": 0.12464155335910618, + "epoch": 8.10958904109589, + "grad_norm": 0.16893954575061798, + "learning_rate": 2.381531506217437e-05, + "loss": 0.06093020439147949, + "mean_token_accuracy": 0.9776258453726768, + "num_tokens": 7612578.0, + "step": 3260 + }, + { + "epoch": 8.10958904109589, + "eval_entropy": 0.24396493017326953, + "eval_loss": 0.891161322593689, + "eval_mean_token_accuracy": 0.8515338024427724, + "eval_num_tokens": 7612578.0, + "eval_runtime": 85.9061, + "eval_samples_per_second": 16.006, + "eval_steps_per_second": 2.002, + "step": 3260 + }, + { + "entropy": 0.12345920228399336, + "epoch": 8.159402241594023, + "grad_norm": 0.14332273602485657, + "learning_rate": 2.262293898372616e-05, + "loss": 0.061289966106414795, + "mean_token_accuracy": 0.9762230902910233, + "num_tokens": 7660157.0, + "step": 3280 + }, + { + "epoch": 8.159402241594023, + "eval_entropy": 0.2481445314059424, + "eval_loss": 0.8922848105430603, + "eval_mean_token_accuracy": 0.8514944855556932, + "eval_num_tokens": 7660157.0, + "eval_runtime": 85.5201, + "eval_samples_per_second": 16.078, + "eval_steps_per_second": 2.011, + "step": 3280 + }, + { + "entropy": 0.12298110066913068, + "epoch": 8.209215442092155, + "grad_norm": 0.21848882734775543, + "learning_rate": 2.1457861534398633e-05, + "loss": 0.05986443758010864, + "mean_token_accuracy": 0.9786281704902648, + "num_tokens": 7709745.0, + "step": 3300 + }, + { + "epoch": 8.209215442092155, + "eval_entropy": 0.24329388124305149, + "eval_loss": 0.9021085500717163, + "eval_mean_token_accuracy": 0.8521762625422589, + "eval_num_tokens": 7709745.0, + "eval_runtime": 85.955, + "eval_samples_per_second": 15.997, + "eval_steps_per_second": 2.001, + "step": 3300 + }, + { + "entropy": 0.13265180448070168, + "epoch": 8.259028642590286, + "grad_norm": 0.18067947030067444, + "learning_rate": 2.0320434085659692e-05, + "loss": 0.06724961400032044, + "mean_token_accuracy": 0.975098168104887, + "num_tokens": 7753571.0, + "step": 3320 + }, + { + "epoch": 8.259028642590286, + "eval_entropy": 0.2433211464694766, + "eval_loss": 0.9094350337982178, + "eval_mean_token_accuracy": 0.8520150094531304, + "eval_num_tokens": 7753571.0, + "eval_runtime": 85.7989, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.005, + "step": 3320 + }, + { + "entropy": 0.11949320202693343, + "epoch": 8.308841843088418, + "grad_norm": 0.17020289599895477, + "learning_rate": 1.9210999670114196e-05, + "loss": 0.0634455680847168, + "mean_token_accuracy": 0.9771294385194779, + "num_tokens": 7799310.0, + "step": 3340 + }, + { + "epoch": 8.308841843088418, + "eval_entropy": 0.24345201219237128, + "eval_loss": 0.9021793603897095, + "eval_mean_token_accuracy": 0.8520745697409607, + "eval_num_tokens": 7799310.0, + "eval_runtime": 86.0883, + "eval_samples_per_second": 15.972, + "eval_steps_per_second": 1.998, + "step": 3340 + }, + { + "entropy": 0.12065747743472457, + "epoch": 8.35865504358655, + "grad_norm": 0.16789060831069946, + "learning_rate": 1.8129892878049886e-05, + "loss": 0.061494195461273195, + "mean_token_accuracy": 0.9779584899544715, + "num_tokens": 7846447.0, + "step": 3360 + }, + { + "epoch": 8.35865504358655, + "eval_entropy": 0.24093415042342142, + "eval_loss": 0.9006755352020264, + "eval_mean_token_accuracy": 0.852174230786257, + "eval_num_tokens": 7846447.0, + "eval_runtime": 85.9011, + "eval_samples_per_second": 16.007, + "eval_steps_per_second": 2.002, + "step": 3360 + }, + { + "entropy": 0.13125578537583352, + "epoch": 8.408468244084682, + "grad_norm": 0.1662452220916748, + "learning_rate": 1.70774397565298e-05, + "loss": 0.06685600876808166, + "mean_token_accuracy": 0.9744067586958408, + "num_tokens": 7890283.0, + "step": 3380 + }, + { + "epoch": 8.408468244084682, + "eval_entropy": 0.24062153688350388, + "eval_loss": 0.9078915119171143, + "eval_mean_token_accuracy": 0.8523201647886011, + "eval_num_tokens": 7890283.0, + "eval_runtime": 86.0201, + "eval_samples_per_second": 15.985, + "eval_steps_per_second": 2.0, + "step": 3380 + }, + { + "entropy": 0.11986117120832204, + "epoch": 8.458281444582815, + "grad_norm": 0.19571948051452637, + "learning_rate": 1.6053957711060606e-05, + "loss": 0.06411095261573792, + "mean_token_accuracy": 0.9770627245306969, + "num_tokens": 7936518.0, + "step": 3400 + }, + { + "epoch": 8.458281444582815, + "eval_entropy": 0.24352820347561394, + "eval_loss": 0.9058943390846252, + "eval_mean_token_accuracy": 0.8519382792156797, + "eval_num_tokens": 7936518.0, + "eval_runtime": 85.966, + "eval_samples_per_second": 15.995, + "eval_steps_per_second": 2.001, + "step": 3400 + }, + { + "entropy": 0.12857897616922856, + "epoch": 8.508094645080947, + "grad_norm": 0.2609264850616455, + "learning_rate": 1.5059755409867613e-05, + "loss": 0.06473397612571716, + "mean_token_accuracy": 0.9764650195837021, + "num_tokens": 7981966.0, + "step": 3420 + }, + { + "epoch": 8.508094645080947, + "eval_entropy": 0.24032609000108962, + "eval_loss": 0.9077776074409485, + "eval_mean_token_accuracy": 0.8517829197090726, + "eval_num_tokens": 7981966.0, + "eval_runtime": 86.6059, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 3420 + }, + { + "entropy": 0.12348870886489749, + "epoch": 8.557907845579079, + "grad_norm": 0.19537609815597534, + "learning_rate": 1.409513269080473e-05, + "loss": 0.06481348872184753, + "mean_token_accuracy": 0.9769559659063816, + "num_tokens": 8028367.0, + "step": 3440 + }, + { + "epoch": 8.557907845579079, + "eval_entropy": 0.2404322574824788, + "eval_loss": 0.9057720899581909, + "eval_mean_token_accuracy": 0.8521037981953732, + "eval_num_tokens": 8028367.0, + "eval_runtime": 86.166, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.996, + "step": 3440 + }, + { + "entropy": 0.12040232736617326, + "epoch": 8.607721046077211, + "grad_norm": 0.3310582935810089, + "learning_rate": 1.3160380470927183e-05, + "loss": 0.06468871235847473, + "mean_token_accuracy": 0.9768650442361831, + "num_tokens": 8074934.0, + "step": 3460 + }, + { + "epoch": 8.607721046077211, + "eval_entropy": 0.24118655876711356, + "eval_loss": 0.9028318524360657, + "eval_mean_token_accuracy": 0.8521025340224422, + "eval_num_tokens": 8074934.0, + "eval_runtime": 85.3668, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.015, + "step": 3460 + }, + { + "entropy": 0.12328103906475008, + "epoch": 8.657534246575342, + "grad_norm": 0.12836167216300964, + "learning_rate": 1.2255780658755122e-05, + "loss": 0.06229386329650879, + "mean_token_accuracy": 0.9763277888298034, + "num_tokens": 8122775.0, + "step": 3480 + }, + { + "epoch": 8.657534246575342, + "eval_entropy": 0.24194598145956217, + "eval_loss": 0.9009329080581665, + "eval_mean_token_accuracy": 0.8521693289973015, + "eval_num_tokens": 8122775.0, + "eval_runtime": 85.9415, + "eval_samples_per_second": 15.999, + "eval_steps_per_second": 2.001, + "step": 3480 + }, + { + "entropy": 0.11321646976284683, + "epoch": 8.707347447073474, + "grad_norm": 0.15656894445419312, + "learning_rate": 1.1381606069253786e-05, + "loss": 0.05908188819885254, + "mean_token_accuracy": 0.9779504477977753, + "num_tokens": 8174307.0, + "step": 3500 + }, + { + "epoch": 8.707347447073474, + "eval_entropy": 0.24121542517528977, + "eval_loss": 0.9016091823577881, + "eval_mean_token_accuracy": 0.8521790667328724, + "eval_num_tokens": 8174307.0, + "eval_runtime": 85.7465, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.006, + "step": 3500 + }, + { + "entropy": 0.12657046681270004, + "epoch": 8.757160647571606, + "grad_norm": 0.22597502171993256, + "learning_rate": 1.053812034155629e-05, + "loss": 0.06244581937789917, + "mean_token_accuracy": 0.976795207709074, + "num_tokens": 8222808.0, + "step": 3520 + }, + { + "epoch": 8.757160647571606, + "eval_entropy": 0.23877542708502258, + "eval_loss": 0.9069110155105591, + "eval_mean_token_accuracy": 0.8522880177858264, + "eval_num_tokens": 8222808.0, + "eval_runtime": 85.7792, + "eval_samples_per_second": 16.03, + "eval_steps_per_second": 2.005, + "step": 3520 + }, + { + "entropy": 0.11422101808711886, + "epoch": 8.806973848069738, + "grad_norm": 0.21139323711395264, + "learning_rate": 9.725577859453502e-06, + "loss": 0.05988085865974426, + "mean_token_accuracy": 0.9779510758817196, + "num_tokens": 8273335.0, + "step": 3540 + }, + { + "epoch": 8.806973848069738, + "eval_entropy": 0.2393161087881687, + "eval_loss": 0.9033801555633545, + "eval_mean_token_accuracy": 0.8522614209457885, + "eval_num_tokens": 8273335.0, + "eval_runtime": 85.5594, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 3540 + }, + { + "entropy": 0.13810604228638113, + "epoch": 8.85678704856787, + "grad_norm": 0.24571993947029114, + "learning_rate": 8.944223674675537e-06, + "loss": 0.07036117911338806, + "mean_token_accuracy": 0.9734892748296261, + "num_tokens": 8315235.0, + "step": 3560 + }, + { + "epoch": 8.85678704856787, + "eval_entropy": 0.23998506947658782, + "eval_loss": 0.9009848833084106, + "eval_mean_token_accuracy": 0.8521793619837872, + "eval_num_tokens": 8315235.0, + "eval_runtime": 86.0974, + "eval_samples_per_second": 15.97, + "eval_steps_per_second": 1.998, + "step": 3560 + }, + { + "entropy": 0.14193559321574867, + "epoch": 8.906600249066003, + "grad_norm": 0.17304112017154694, + "learning_rate": 8.194293432987386e-06, + "loss": 0.07077967524528503, + "mean_token_accuracy": 0.973305893689394, + "num_tokens": 8358099.0, + "step": 3580 + }, + { + "epoch": 8.906600249066003, + "eval_entropy": 0.23883876689644748, + "eval_loss": 0.9015622138977051, + "eval_mean_token_accuracy": 0.8524864378363587, + "eval_num_tokens": 8358099.0, + "eval_runtime": 86.0089, + "eval_samples_per_second": 15.987, + "eval_steps_per_second": 2.0, + "step": 3580 + }, + { + "entropy": 0.11878943420015275, + "epoch": 8.956413449564135, + "grad_norm": 0.19075658917427063, + "learning_rate": 7.476013303121426e-06, + "loss": 0.060806107521057126, + "mean_token_accuracy": 0.9776863709092141, + "num_tokens": 8407430.0, + "step": 3600 + }, + { + "epoch": 8.956413449564135, + "eval_entropy": 0.23726526309931, + "eval_loss": 0.9060276746749878, + "eval_mean_token_accuracy": 0.8524192058762838, + "eval_num_tokens": 8407430.0, + "eval_runtime": 85.7252, + "eval_samples_per_second": 16.04, + "eval_steps_per_second": 2.006, + "step": 3600 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.5487499397432525e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3620/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3620/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3620/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3620/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3620/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3620/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3620/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3620/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3620/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3620/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3620/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3620/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3620/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3620/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..c74165afdccfd2fe75bc8e2d6f3ae1d915eab8a8 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3620/trainer_state.json @@ -0,0 +1,3835 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 9.004981320049813, + "eval_steps": 20, + "global_step": 3620, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + }, + { + "entropy": 0.561330484598875, + "epoch": 1.891656288916563, + "grad_norm": 0.6722865700721741, + "learning_rate": 0.0002208867897174789, + "loss": 0.499837589263916, + "mean_token_accuracy": 0.8518734864890576, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.5865232653396074, + "eval_loss": 0.5437926650047302, + "eval_mean_token_accuracy": 0.8450997017843779, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4116, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.547389242425561, + "epoch": 1.9414694894146949, + "grad_norm": 0.7935577034950256, + "learning_rate": 0.00022027119820226907, + "loss": 0.4977591514587402, + "mean_token_accuracy": 0.8539491161704064, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.5290903090391048, + "eval_loss": 0.5409526824951172, + "eval_mean_token_accuracy": 0.8497545698354411, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.7262, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 780 + }, + { + "entropy": 0.5687909748405218, + "epoch": 1.9912826899128269, + "grad_norm": 0.6180546283721924, + "learning_rate": 0.00021962329729698345, + "loss": 0.5109643459320068, + "mean_token_accuracy": 0.8521598495543004, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.5503541858390321, + "eval_loss": 0.5361555218696594, + "eval_mean_token_accuracy": 0.8510884285666221, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.3339, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 800 + }, + { + "entropy": 0.4739728841261986, + "epoch": 2.0398505603985058, + "grad_norm": 0.8058829307556152, + "learning_rate": 0.0002189432823996982, + "loss": 0.4204097747802734, + "mean_token_accuracy": 0.8728981889211215, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.5077334992414297, + "eval_loss": 0.5531114339828491, + "eval_mean_token_accuracy": 0.8489257208136625, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.4801, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.989, + "step": 820 + }, + { + "entropy": 0.4594309840351343, + "epoch": 2.0896637608966375, + "grad_norm": 0.6906896829605103, + "learning_rate": 0.0002182313585936314, + "loss": 0.4071959495544434, + "mean_token_accuracy": 0.8732857562601566, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.49850136994622474, + "eval_loss": 0.5486204624176025, + "eval_mean_token_accuracy": 0.8507991450470548, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.3364, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.4881629109382629, + "epoch": 2.1394769613947697, + "grad_norm": 0.6343470215797424, + "learning_rate": 0.0002174877405852928, + "loss": 0.41669540405273436, + "mean_token_accuracy": 0.8711295068264008, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.49155513924914734, + "eval_loss": 0.555109441280365, + "eval_mean_token_accuracy": 0.8496399400539176, + "eval_num_tokens": 2008562.0, + "eval_runtime": 86.3295, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 860 + }, + { + "entropy": 0.4648668970912695, + "epoch": 2.1892901618929015, + "grad_norm": 0.8014165163040161, + "learning_rate": 0.00021671265263973133, + "loss": 0.4110250473022461, + "mean_token_accuracy": 0.8754166305065155, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.4909258722219356, + "eval_loss": 0.5539511442184448, + "eval_mean_token_accuracy": 0.8492401502160138, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.3468, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 880 + }, + { + "entropy": 0.4824485514312983, + "epoch": 2.2391033623910337, + "grad_norm": 0.6665191054344177, + "learning_rate": 0.00021590632851289967, + "loss": 0.4181404113769531, + "mean_token_accuracy": 0.8726993151009083, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.4986876940657926, + "eval_loss": 0.547695517539978, + "eval_mean_token_accuracy": 0.8501384708770486, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.3838, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 900 + }, + { + "entropy": 0.4751896943897009, + "epoch": 2.2889165628891655, + "grad_norm": 0.81158047914505, + "learning_rate": 0.00021506901138115678, + "loss": 0.40689678192138673, + "mean_token_accuracy": 0.8745221219956875, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.507153491121392, + "eval_loss": 0.5501641631126404, + "eval_mean_token_accuracy": 0.8495670116918032, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.0912, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 920 + }, + { + "entropy": 0.4873133715242147, + "epoch": 2.3387297633872977, + "grad_norm": 0.7218056321144104, + "learning_rate": 0.0002142009537679292, + "loss": 0.42701358795166017, + "mean_token_accuracy": 0.8695114746689796, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5202612736543943, + "eval_loss": 0.5491839051246643, + "eval_mean_token_accuracy": 0.8494071208460386, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.1142, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 940 + }, + { + "entropy": 0.4762951169162989, + "epoch": 2.3885429638854294, + "grad_norm": 0.7194424867630005, + "learning_rate": 0.0002133024174675534, + "loss": 0.42299847602844237, + "mean_token_accuracy": 0.8709790132939815, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4899340462546016, + "eval_loss": 0.5522511601448059, + "eval_mean_token_accuracy": 0.8492208258357159, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.463, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 960 + }, + { + "entropy": 0.49650347977876663, + "epoch": 2.4383561643835616, + "grad_norm": 0.8406022787094116, + "learning_rate": 0.0002123736734663221, + "loss": 0.4275330066680908, + "mean_token_accuracy": 0.8670595556497573, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.49691385654515996, + "eval_loss": 0.5491269826889038, + "eval_mean_token_accuracy": 0.850309816210769, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.17, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 980 + }, + { + "entropy": 0.48843890577554705, + "epoch": 2.488169364881694, + "grad_norm": 0.9082473516464233, + "learning_rate": 0.00021141500186075868, + "loss": 0.4309722423553467, + "mean_token_accuracy": 0.8686766296625137, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5543508351195691, + "eval_loss": 0.5478800535202026, + "eval_mean_token_accuracy": 0.8478029522784921, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.3835, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 1000 + }, + { + "entropy": 0.4777219031006098, + "epoch": 2.5379825653798256, + "grad_norm": 0.7448089122772217, + "learning_rate": 0.0002104266917731438, + "loss": 0.423325252532959, + "mean_token_accuracy": 0.8706337086856365, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.49857561550168106, + "eval_loss": 0.5511948466300964, + "eval_mean_token_accuracy": 0.8502220289651737, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.5399, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.988, + "step": 1020 + }, + { + "entropy": 0.4844174191355705, + "epoch": 2.587795765877958, + "grad_norm": 0.794029176235199, + "learning_rate": 0.00020940904126432, + "loss": 0.4176753044128418, + "mean_token_accuracy": 0.873535567522049, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.485467542222766, + "eval_loss": 0.5539286732673645, + "eval_mean_token_accuracy": 0.8495475081510322, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.135, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 1.997, + "step": 1040 + }, + { + "entropy": 0.49070929251611234, + "epoch": 2.6376089663760895, + "grad_norm": 0.7558256983757019, + "learning_rate": 0.0002083623572438007, + "loss": 0.42867293357849123, + "mean_token_accuracy": 0.8696666076779366, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.490822730889154, + "eval_loss": 0.5434785485267639, + "eval_mean_token_accuracy": 0.850568296950917, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.4933, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 1060 + }, + { + "entropy": 0.47806114703416824, + "epoch": 2.6874221668742218, + "grad_norm": 0.6608979105949402, + "learning_rate": 0.00020728695537721047, + "loss": 0.4289727687835693, + "mean_token_accuracy": 0.8693130135536193, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.5285773256490397, + "eval_loss": 0.5444230437278748, + "eval_mean_token_accuracy": 0.8498796481032704, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.7091, + "eval_samples_per_second": 15.858, + "eval_steps_per_second": 1.984, + "step": 1080 + }, + { + "entropy": 0.5046216730028391, + "epoch": 2.7372353673723535, + "grad_norm": 0.8428544998168945, + "learning_rate": 0.00020618315999108454, + "loss": 0.43131070137023925, + "mean_token_accuracy": 0.8701941035687923, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.49888394738352576, + "eval_loss": 0.5459766387939453, + "eval_mean_token_accuracy": 0.8511758872935938, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.2222, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.995, + "step": 1100 + }, + { + "entropy": 0.5212558470666409, + "epoch": 2.7870485678704857, + "grad_norm": 1.129318118095398, + "learning_rate": 0.00020505130397505635, + "loss": 0.44249300956726073, + "mean_token_accuracy": 0.8654101334512234, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5179622324053631, + "eval_loss": 0.5522801280021667, + "eval_mean_token_accuracy": 0.8497019947268242, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.1903, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.996, + "step": 1120 + }, + { + "entropy": 0.4988406613469124, + "epoch": 2.8368617683686175, + "grad_norm": 0.6460545063018799, + "learning_rate": 0.00020389172868146263, + "loss": 0.4386270523071289, + "mean_token_accuracy": 0.8690383620560169, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.5042278484203094, + "eval_loss": 0.5433034300804138, + "eval_mean_token_accuracy": 0.8497674451317898, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.3028, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.993, + "step": 1140 + }, + { + "entropy": 0.4926559619605541, + "epoch": 2.8866749688667497, + "grad_norm": 0.8199329972267151, + "learning_rate": 0.00020270478382239615, + "loss": 0.4313485145568848, + "mean_token_accuracy": 0.8674727231264114, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.503873193160046, + "eval_loss": 0.5388111472129822, + "eval_mean_token_accuracy": 0.8526195034731266, + "eval_num_tokens": 2710196.0, + "eval_runtime": 86.4054, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.991, + "step": 1160 + }, + { + "entropy": 0.5020013231784105, + "epoch": 2.936488169364882, + "grad_norm": 0.7344821095466614, + "learning_rate": 0.00020149082736423723, + "loss": 0.43590536117553713, + "mean_token_accuracy": 0.8671772189438343, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5368241809828337, + "eval_loss": 0.5355703830718994, + "eval_mean_token_accuracy": 0.8517617773871089, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.2945, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1180 + }, + { + "entropy": 0.5112275708466768, + "epoch": 2.9863013698630136, + "grad_norm": 0.6951606869697571, + "learning_rate": 0.00020025022541969622, + "loss": 0.43579301834106443, + "mean_token_accuracy": 0.8641206480562686, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.5066795706055885, + "eval_loss": 0.5415249466896057, + "eval_mean_token_accuracy": 0.8493563373421513, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.5005, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.988, + "step": 1200 + }, + { + "entropy": 0.42298635305502474, + "epoch": 3.0348692403486925, + "grad_norm": 0.8201794028282166, + "learning_rate": 0.00019898335213739863, + "loss": 0.35593905448913576, + "mean_token_accuracy": 0.889238600547497, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.4584170470750609, + "eval_loss": 0.569487452507019, + "eval_mean_token_accuracy": 0.8495814173027526, + "eval_num_tokens": 2848509.0, + "eval_runtime": 86.2281, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 1220 + }, + { + "entropy": 0.37450140453875064, + "epoch": 3.0846824408468243, + "grad_norm": 0.7308394908905029, + "learning_rate": 0.0001976905895890471, + "loss": 0.307823920249939, + "mean_token_accuracy": 0.9001288741827012, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.45185995916294497, + "eval_loss": 0.5672881603240967, + "eval_mean_token_accuracy": 0.8511318519364955, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.0819, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.998, + "step": 1240 + }, + { + "entropy": 0.3887945845723152, + "epoch": 3.1344956413449565, + "grad_norm": 0.7299330830574036, + "learning_rate": 0.0001963723276541939, + "loss": 0.32047903537750244, + "mean_token_accuracy": 0.8960984498262405, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.44865354549053105, + "eval_loss": 0.5666037201881409, + "eval_mean_token_accuracy": 0.8496572649063066, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 1260 + }, + { + "entropy": 0.39677664265036583, + "epoch": 3.1843088418430883, + "grad_norm": 0.9533219933509827, + "learning_rate": 0.00019502896390265838, + "loss": 0.3253983497619629, + "mean_token_accuracy": 0.8964207418262958, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.4641980809527774, + "eval_loss": 0.5814996957778931, + "eval_mean_token_accuracy": 0.8485886212005171, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.7784, + "eval_samples_per_second": 15.845, + "eval_steps_per_second": 1.982, + "step": 1280 + }, + { + "entropy": 0.39210722744464876, + "epoch": 3.2341220423412205, + "grad_norm": 0.7447651028633118, + "learning_rate": 0.00019366090347462545, + "loss": 0.3276803970336914, + "mean_token_accuracy": 0.8930055953562259, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43595615254585135, + "eval_loss": 0.5722188353538513, + "eval_mean_token_accuracy": 0.8501105755567551, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.5271, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 1300 + }, + { + "entropy": 0.3684127271175385, + "epoch": 3.2839352428393527, + "grad_norm": 0.6934201121330261, + "learning_rate": 0.00019226855895846078, + "loss": 0.3156379222869873, + "mean_token_accuracy": 0.8976306475698947, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.4628148723480313, + "eval_loss": 0.5631352066993713, + "eval_mean_token_accuracy": 0.8504934813394103, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.3436, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 1320 + }, + { + "entropy": 0.4073401909321547, + "epoch": 3.3337484433374844, + "grad_norm": 0.9386897683143616, + "learning_rate": 0.00019085235026627994, + "loss": 0.34265310764312745, + "mean_token_accuracy": 0.8902062118053437, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.46455050623694133, + "eval_loss": 0.5586736798286438, + "eval_mean_token_accuracy": 0.8506874702004499, + "eval_num_tokens": 3132874.0, + "eval_runtime": 86.1286, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.997, + "step": 1340 + }, + { + "entropy": 0.4046429242938757, + "epoch": 3.383561643835616, + "grad_norm": 0.9633992314338684, + "learning_rate": 0.00018941270450730836, + "loss": 0.33816893100738527, + "mean_token_accuracy": 0.8927541889250279, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.46846531660750856, + "eval_loss": 0.561501681804657, + "eval_mean_token_accuracy": 0.8496256377114806, + "eval_num_tokens": 3178055.0, + "eval_runtime": 86.685, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1360 + }, + { + "entropy": 0.39872407019138334, + "epoch": 3.4333748443337484, + "grad_norm": 0.7786458730697632, + "learning_rate": 0.00018795005585907113, + "loss": 0.33342490196228025, + "mean_token_accuracy": 0.8944805048406124, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.42709505973860273, + "eval_loss": 0.5751848220825195, + "eval_mean_token_accuracy": 0.8507290447867194, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.6892, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 1380 + }, + { + "entropy": 0.3923338124528527, + "epoch": 3.4831880448318806, + "grad_norm": 0.9305956363677979, + "learning_rate": 0.0001864648454364511, + "loss": 0.33188116550445557, + "mean_token_accuracy": 0.8943330392241478, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.4386174779298694, + "eval_loss": 0.5680831074714661, + "eval_mean_token_accuracy": 0.8513129727784977, + "eval_num_tokens": 3274096.0, + "eval_runtime": 86.2671, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 1400 + }, + { + "entropy": 0.3856233984231949, + "epoch": 3.5330012453300124, + "grad_norm": 1.0362752676010132, + "learning_rate": 0.0001849575211586545, + "loss": 0.33098697662353516, + "mean_token_accuracy": 0.8961390435695649, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4574795474493226, + "eval_loss": 0.5630439519882202, + "eval_mean_token_accuracy": 0.8520988873964133, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.6035, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 1420 + }, + { + "entropy": 0.39812871962785723, + "epoch": 3.5828144458281446, + "grad_norm": 0.7807195782661438, + "learning_rate": 0.0001834285376141247, + "loss": 0.3333771228790283, + "mean_token_accuracy": 0.8930827379226685, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.4556825893909432, + "eval_loss": 0.5689062476158142, + "eval_mean_token_accuracy": 0.8507103507601937, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.1606, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.996, + "step": 1440 + }, + { + "entropy": 0.4147744856774807, + "epoch": 3.6326276463262763, + "grad_norm": 0.6429352164268494, + "learning_rate": 0.00018187835592344443, + "loss": 0.3482560873031616, + "mean_token_accuracy": 0.8910200245678425, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.46600024540757023, + "eval_loss": 0.5609709024429321, + "eval_mean_token_accuracy": 0.8491220876227977, + "eval_num_tokens": 3415600.0, + "eval_runtime": 86.8039, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1460 + }, + { + "entropy": 0.40425071083009245, + "epoch": 3.6824408468244085, + "grad_norm": 0.8613698482513428, + "learning_rate": 0.0001803074436002682, + "loss": 0.342916464805603, + "mean_token_accuracy": 0.8916418336331844, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.43855057899342026, + "eval_loss": 0.5720968246459961, + "eval_mean_token_accuracy": 0.8500823641932288, + "eval_num_tokens": 3460471.0, + "eval_runtime": 86.6746, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1480 + }, + { + "entropy": 0.39465143866837027, + "epoch": 3.7322540473225407, + "grad_norm": 0.6285189986228943, + "learning_rate": 0.0001787162744103265, + "loss": 0.3424591779708862, + "mean_token_accuracy": 0.8906558901071548, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4509461877304454, + "eval_loss": 0.5590082406997681, + "eval_mean_token_accuracy": 0.8511747371318729, + "eval_num_tokens": 3507647.0, + "eval_runtime": 86.8126, + "eval_samples_per_second": 15.839, + "eval_steps_per_second": 1.981, + "step": 1500 + }, + { + "entropy": 0.4021005939692259, + "epoch": 3.7820672478206725, + "grad_norm": 0.8821248412132263, + "learning_rate": 0.00017710532822854468, + "loss": 0.3462103843688965, + "mean_token_accuracy": 0.889109355956316, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.4502199075596277, + "eval_loss": 0.566046416759491, + "eval_mean_token_accuracy": 0.8501714208098345, + "eval_num_tokens": 3548934.0, + "eval_runtime": 86.8336, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.981, + "step": 1520 + }, + { + "entropy": 0.4017397932708263, + "epoch": 3.8318804483188043, + "grad_norm": 0.8400952816009521, + "learning_rate": 0.0001754750908943189, + "loss": 0.34890995025634763, + "mean_token_accuracy": 0.8892098367214203, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.4614003023435903, + "eval_loss": 0.5617933869361877, + "eval_mean_token_accuracy": 0.8515863616106122, + "eval_num_tokens": 3597186.0, + "eval_runtime": 86.4609, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 1540 + }, + { + "entropy": 0.4112051840871572, + "epoch": 3.8816936488169365, + "grad_norm": 0.769478440284729, + "learning_rate": 0.0001738260540649939, + "loss": 0.34711437225341796, + "mean_token_accuracy": 0.8911717928946018, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4540443811998811, + "eval_loss": 0.5576469898223877, + "eval_mean_token_accuracy": 0.8512079674144124, + "eval_num_tokens": 3646646.0, + "eval_runtime": 86.5103, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 1560 + }, + { + "entropy": 0.41105241514742374, + "epoch": 3.9315068493150687, + "grad_norm": 0.8468427062034607, + "learning_rate": 0.00017215871506758568, + "loss": 0.3433023452758789, + "mean_token_accuracy": 0.8898739732801915, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.4707539707075718, + "eval_loss": 0.5641466379165649, + "eval_mean_token_accuracy": 0.8495440957851188, + "eval_num_tokens": 3689560.0, + "eval_runtime": 86.609, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.986, + "step": 1580 + }, + { + "entropy": 0.41016379147768023, + "epoch": 3.9813200498132004, + "grad_norm": 0.7482675313949585, + "learning_rate": 0.0001704735767487946, + "loss": 0.34550890922546384, + "mean_token_accuracy": 0.8893028847873211, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.46391099864660307, + "eval_loss": 0.5593640804290771, + "eval_mean_token_accuracy": 0.8510130581467651, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.3975, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 1600 + }, + { + "entropy": 0.33167599791135544, + "epoch": 4.029887920298879, + "grad_norm": 0.9435692429542542, + "learning_rate": 0.00016877114732335337, + "loss": 0.2716026544570923, + "mean_token_accuracy": 0.9133149828666296, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.38499350005457567, + "eval_loss": 0.6298249363899231, + "eval_mean_token_accuracy": 0.8488117071778275, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.2933, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1620 + }, + { + "entropy": 0.3000166634097695, + "epoch": 4.0797011207970115, + "grad_norm": 0.8080845475196838, + "learning_rate": 0.0001670519402207569, + "loss": 0.22617182731628419, + "mean_token_accuracy": 0.9253474645316601, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.370110988703578, + "eval_loss": 0.6338461637496948, + "eval_mean_token_accuracy": 0.8485634801692741, + "eval_num_tokens": 3828830.0, + "eval_runtime": 85.9508, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.001, + "step": 1640 + }, + { + "entropy": 0.2986910421401262, + "epoch": 4.129514321295143, + "grad_norm": 0.7310900092124939, + "learning_rate": 0.0001653164739304185, + "loss": 0.22367463111877442, + "mean_token_accuracy": 0.9252275295555592, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.3944379702037157, + "eval_loss": 0.6109381914138794, + "eval_mean_token_accuracy": 0.849291454220927, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.6728, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1660 + }, + { + "entropy": 0.3095553796738386, + "epoch": 4.179327521793275, + "grad_norm": 0.7059140801429749, + "learning_rate": 0.0001635652718453007, + "loss": 0.23651680946350098, + "mean_token_accuracy": 0.9208931416273117, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.3910588648949945, + "eval_loss": 0.6104469299316406, + "eval_mean_token_accuracy": 0.8486883893262508, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7612, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.982, + "step": 1680 + }, + { + "entropy": 0.3001101028174162, + "epoch": 4.229140722291407, + "grad_norm": 0.6787802577018738, + "learning_rate": 0.00016179886210406728, + "loss": 0.23130471706390382, + "mean_token_accuracy": 0.9233332790434361, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3794369170832079, + "eval_loss": 0.6182110905647278, + "eval_mean_token_accuracy": 0.8495433777570724, + "eval_num_tokens": 3967474.0, + "eval_runtime": 85.94, + "eval_samples_per_second": 16.0, + "eval_steps_per_second": 2.001, + "step": 1700 + }, + { + "entropy": 0.3031421799212694, + "epoch": 4.2789539227895395, + "grad_norm": 0.9732038378715515, + "learning_rate": 0.0001600177774318036, + "loss": 0.2359529733657837, + "mean_token_accuracy": 0.9217648565769195, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3923123094231583, + "eval_loss": 0.6057384610176086, + "eval_mean_token_accuracy": 0.8508818288182103, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7647, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.29365369994193313, + "epoch": 4.328767123287671, + "grad_norm": 0.7681498527526855, + "learning_rate": 0.0001582225549793541, + "loss": 0.2269371747970581, + "mean_token_accuracy": 0.9245341829955578, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.4011661055129628, + "eval_loss": 0.6144486665725708, + "eval_mean_token_accuracy": 0.8480324357054955, + "eval_num_tokens": 4062594.0, + "eval_runtime": 87.1306, + "eval_samples_per_second": 15.781, + "eval_steps_per_second": 1.974, + "step": 1740 + }, + { + "entropy": 0.29396994728595016, + "epoch": 4.378580323785803, + "grad_norm": 1.0001007318496704, + "learning_rate": 0.0001564137361613248, + "loss": 0.22777395248413085, + "mean_token_accuracy": 0.9262309700250626, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38518730195802314, + "eval_loss": 0.6202630400657654, + "eval_mean_token_accuracy": 0.8493869807137999, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6616, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.3096018506214023, + "epoch": 4.428393524283935, + "grad_norm": 1.0448365211486816, + "learning_rate": 0.00015459186649280024, + "loss": 0.23696351051330566, + "mean_token_accuracy": 0.9217322513461113, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.3946371126140273, + "eval_loss": 0.6079026460647583, + "eval_mean_token_accuracy": 0.8492515852978063, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6582, + "eval_samples_per_second": 15.867, + "eval_steps_per_second": 1.985, + "step": 1780 + }, + { + "entropy": 0.32619857545942066, + "epoch": 4.478206724782067, + "grad_norm": 0.7210651636123657, + "learning_rate": 0.00015275749542482337, + "loss": 0.24651215076446534, + "mean_token_accuracy": 0.9177676141262054, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.3947690814560236, + "eval_loss": 0.6065912246704102, + "eval_mean_token_accuracy": 0.8502957744653835, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.5959, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.986, + "step": 1800 + }, + { + "entropy": 0.3193941755220294, + "epoch": 4.5280199252802, + "grad_norm": 0.8281906843185425, + "learning_rate": 0.0001509111761786888, + "loss": 0.23936262130737304, + "mean_token_accuracy": 0.9201708927750587, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38704028864239537, + "eval_loss": 0.6006569266319275, + "eval_mean_token_accuracy": 0.8502406720505205, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.8059, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1820 + }, + { + "entropy": 0.3164879363030195, + "epoch": 4.577833125778331, + "grad_norm": 0.7892968654632568, + "learning_rate": 0.00014905346557909867, + "loss": 0.24541733264923096, + "mean_token_accuracy": 0.9175932116806507, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.38861122120951497, + "eval_loss": 0.6115967631340027, + "eval_mean_token_accuracy": 0.849471275196519, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.2946, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1840 + }, + { + "entropy": 0.3051785985007882, + "epoch": 4.627646326276463, + "grad_norm": 0.8109654188156128, + "learning_rate": 0.0001471849238862319, + "loss": 0.23433220386505127, + "mean_token_accuracy": 0.9206570319831371, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.37162452295076015, + "eval_loss": 0.6184061765670776, + "eval_mean_token_accuracy": 0.8501173268223918, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.6865, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1860 + }, + { + "entropy": 0.3168198253959417, + "epoch": 4.677459526774595, + "grad_norm": 0.9512342214584351, + "learning_rate": 0.0001453061146267775, + "loss": 0.23832404613494873, + "mean_token_accuracy": 0.9197044663131237, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3845940856912801, + "eval_loss": 0.606762707233429, + "eval_mean_token_accuracy": 0.8504838194957999, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.5175, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 1880 + }, + { + "entropy": 0.30791807882487776, + "epoch": 4.7272727272727275, + "grad_norm": 0.8123113512992859, + "learning_rate": 0.00014341760442398248, + "loss": 0.2395785331726074, + "mean_token_accuracy": 0.918928150832653, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.39762327222283494, + "eval_loss": 0.5994202494621277, + "eval_mean_token_accuracy": 0.8509274201337681, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.2873, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.993, + "step": 1900 + }, + { + "entropy": 0.3021434534341097, + "epoch": 4.777085927770859, + "grad_norm": 0.731787383556366, + "learning_rate": 0.000141519962826766, + "loss": 0.23494718074798585, + "mean_token_accuracy": 0.9201403826475143, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.3827026732439219, + "eval_loss": 0.5995895862579346, + "eval_mean_token_accuracy": 0.851468373523202, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.3006, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 1920 + }, + { + "entropy": 0.31626159623265265, + "epoch": 4.826899128268991, + "grad_norm": 0.8848487138748169, + "learning_rate": 0.00013961376213795132, + "loss": 0.2439030647277832, + "mean_token_accuracy": 0.9196575872600079, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.388698436839636, + "eval_loss": 0.6000174283981323, + "eval_mean_token_accuracy": 0.8518068187458571, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.8979, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.979, + "step": 1940 + }, + { + "entropy": 0.30520407035946845, + "epoch": 4.876712328767123, + "grad_norm": 0.8532460927963257, + "learning_rate": 0.00013769957724166695, + "loss": 0.23458616733551024, + "mean_token_accuracy": 0.9221912942826748, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.38777847102908203, + "eval_loss": 0.6004981398582458, + "eval_mean_token_accuracy": 0.8516481768253238, + "eval_num_tokens": 4578167.0, + "eval_runtime": 87.0777, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.975, + "step": 1960 + }, + { + "entropy": 0.3226448342204094, + "epoch": 4.926525529265255, + "grad_norm": 0.6945561766624451, + "learning_rate": 0.0001357779854299694, + "loss": 0.24048397541046143, + "mean_token_accuracy": 0.9195300146937371, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.38581624263247777, + "eval_loss": 0.6029234528541565, + "eval_mean_token_accuracy": 0.8514213260523108, + "eval_num_tokens": 4622316.0, + "eval_runtime": 85.8729, + "eval_samples_per_second": 16.012, + "eval_steps_per_second": 2.003, + "step": 1980 + }, + { + "entropy": 0.3051655298098922, + "epoch": 4.976338729763388, + "grad_norm": 0.7976452708244324, + "learning_rate": 0.00013384956622874001, + "loss": 0.23584742546081544, + "mean_token_accuracy": 0.9216851457953453, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.37913159246361533, + "eval_loss": 0.6057604551315308, + "eval_mean_token_accuracy": 0.8525801203971686, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.1145, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 2000 + }, + { + "entropy": 0.27438195240803254, + "epoch": 5.024906600249066, + "grad_norm": 0.6729586124420166, + "learning_rate": 0.0001319149012229075, + "loss": 0.19775952100753785, + "mean_token_accuracy": 0.9339428559327737, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.3448961910813354, + "eval_loss": 0.6750120520591736, + "eval_mean_token_accuracy": 0.8487970232963562, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.1169, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 2020 + }, + { + "entropy": 0.21423916313797237, + "epoch": 5.074719800747198, + "grad_norm": 0.6934391856193542, + "learning_rate": 0.00012997457388105022, + "loss": 0.1439570426940918, + "mean_token_accuracy": 0.9528236843645572, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.3570949243771475, + "eval_loss": 0.6465504169464111, + "eval_mean_token_accuracy": 0.8490785547467166, + "eval_num_tokens": 4763269.0, + "eval_runtime": 85.9574, + "eval_samples_per_second": 15.996, + "eval_steps_per_second": 2.001, + "step": 2040 + }, + { + "entropy": 0.20838565267622472, + "epoch": 5.12453300124533, + "grad_norm": 0.7286986112594604, + "learning_rate": 0.00012802916937942972, + "loss": 0.14467307329177856, + "mean_token_accuracy": 0.950994835793972, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.3452463157821533, + "eval_loss": 0.6705958843231201, + "eval_mean_token_accuracy": 0.8490352796953778, + "eval_num_tokens": 4809047.0, + "eval_runtime": 86.228, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 2060 + }, + { + "entropy": 0.20453082229942082, + "epoch": 5.174346201743462, + "grad_norm": 0.7515555620193481, + "learning_rate": 0.00012607927442550974, + "loss": 0.13732000589370727, + "mean_token_accuracy": 0.9537357829511166, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.32431264914745506, + "eval_loss": 0.6743043065071106, + "eval_mean_token_accuracy": 0.8504878629085629, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.5948, + "eval_samples_per_second": 15.879, + "eval_steps_per_second": 1.986, + "step": 2080 + }, + { + "entropy": 0.21812320686876774, + "epoch": 5.224159402241594, + "grad_norm": 0.9093465209007263, + "learning_rate": 0.0001241254770810132, + "loss": 0.14311420917510986, + "mean_token_accuracy": 0.9514068141579628, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.33086285835435225, + "eval_loss": 0.6676449179649353, + "eval_mean_token_accuracy": 0.8505287662495015, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 2100 + }, + { + "entropy": 0.2180163251236081, + "epoch": 5.273972602739726, + "grad_norm": 0.6703007221221924, + "learning_rate": 0.00012216836658457075, + "loss": 0.14803968667984008, + "mean_token_accuracy": 0.9521303348243236, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.33162341708707255, + "eval_loss": 0.6658875942230225, + "eval_mean_token_accuracy": 0.8500757605530495, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.6296, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 2120 + }, + { + "entropy": 0.22511130161583423, + "epoch": 5.323785803237858, + "grad_norm": 0.8078880906105042, + "learning_rate": 0.00012020853317401455, + "loss": 0.15228408575057983, + "mean_token_accuracy": 0.947144789993763, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3354601170434508, + "eval_loss": 0.6677829623222351, + "eval_mean_token_accuracy": 0.8482600024273229, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.4689, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.989, + "step": 2140 + }, + { + "entropy": 0.2244176059961319, + "epoch": 5.37359900373599, + "grad_norm": 0.9636075496673584, + "learning_rate": 0.00011824656790837037, + "loss": 0.15260883569717407, + "mean_token_accuracy": 0.9471467643976211, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.3381616926297199, + "eval_loss": 0.6694412231445312, + "eval_mean_token_accuracy": 0.8482369603805764, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.4147, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 2160 + }, + { + "entropy": 0.22982364390045404, + "epoch": 5.423412204234122, + "grad_norm": 0.775401771068573, + "learning_rate": 0.00011628306248960262, + "loss": 0.15140302181243898, + "mean_token_accuracy": 0.9492553934454918, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.3305150235808173, + "eval_loss": 0.6717822551727295, + "eval_mean_token_accuracy": 0.8489849723355715, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.4728, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.989, + "step": 2180 + }, + { + "entropy": 0.21448935717344284, + "epoch": 5.473225404732254, + "grad_norm": 0.6575281023979187, + "learning_rate": 0.00011431860908416465, + "loss": 0.1452319622039795, + "mean_token_accuracy": 0.9505287684500218, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3488145174328671, + "eval_loss": 0.6612305641174316, + "eval_mean_token_accuracy": 0.8492907808963642, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6927, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 2200 + }, + { + "entropy": 0.23091202937066554, + "epoch": 5.523038605230386, + "grad_norm": 0.8909686207771301, + "learning_rate": 0.00011235380014440985, + "loss": 0.15150139331817628, + "mean_token_accuracy": 0.9497875183820724, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.3268539015810157, + "eval_loss": 0.6667542457580566, + "eval_mean_token_accuracy": 0.8499062903398691, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.4644, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 2220 + }, + { + "entropy": 0.2227974807843566, + "epoch": 5.572851805728518, + "grad_norm": 0.6180275082588196, + "learning_rate": 0.0001103892282299158, + "loss": 0.1491069197654724, + "mean_token_accuracy": 0.9488144010305405, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3346347655494546, + "eval_loss": 0.6665948629379272, + "eval_mean_token_accuracy": 0.8499961893918903, + "eval_num_tokens": 5226864.0, + "eval_runtime": 87.0548, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.976, + "step": 2240 + }, + { + "entropy": 0.21368421968072654, + "epoch": 5.62266500622665, + "grad_norm": 0.6004369258880615, + "learning_rate": 0.00010842548582877651, + "loss": 0.14485255479812623, + "mean_token_accuracy": 0.9502056457102299, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.32753298804163933, + "eval_loss": 0.6680151224136353, + "eval_mean_token_accuracy": 0.8515451086121936, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.8524, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.98, + "step": 2260 + }, + { + "entropy": 0.2103635374456644, + "epoch": 5.672478206724782, + "grad_norm": 0.699174702167511, + "learning_rate": 0.00010646316517891613, + "loss": 0.14297772645950318, + "mean_token_accuracy": 0.9512537539005279, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.32966585959806, + "eval_loss": 0.675578773021698, + "eval_mean_token_accuracy": 0.8509623023659684, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.4518, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.99, + "step": 2280 + }, + { + "entropy": 0.22516900151968003, + "epoch": 5.722291407222914, + "grad_norm": 0.6637354493141174, + "learning_rate": 0.00010450285808947797, + "loss": 0.15202572345733642, + "mean_token_accuracy": 0.9482452072203159, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3369456917740578, + "eval_loss": 0.6697061061859131, + "eval_mean_token_accuracy": 0.848603522361711, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.6371, + "eval_samples_per_second": 15.871, + "eval_steps_per_second": 1.985, + "step": 2300 + }, + { + "entropy": 0.21841065725311637, + "epoch": 5.772104607721046, + "grad_norm": 0.7940268516540527, + "learning_rate": 0.00010254515576234297, + "loss": 0.14710167646408082, + "mean_token_accuracy": 0.9493498183786869, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3237486180177955, + "eval_loss": 0.6779657602310181, + "eval_mean_token_accuracy": 0.8500715313955794, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.1826, + "eval_samples_per_second": 15.954, + "eval_steps_per_second": 1.996, + "step": 2320 + }, + { + "entropy": 0.22146204356104135, + "epoch": 5.821917808219178, + "grad_norm": 0.9234833121299744, + "learning_rate": 0.00010059064861383132, + "loss": 0.14720046520233154, + "mean_token_accuracy": 0.9493872679769992, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.32365207564692167, + "eval_loss": 0.6704005002975464, + "eval_mean_token_accuracy": 0.8507985760306203, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.5494, + "eval_samples_per_second": 15.887, + "eval_steps_per_second": 1.987, + "step": 2340 + }, + { + "entropy": 0.20934011954814197, + "epoch": 5.87173100871731, + "grad_norm": 0.5547503232955933, + "learning_rate": 9.863992609664084e-05, + "loss": 0.1464867353439331, + "mean_token_accuracy": 0.9503875687718392, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.3330401429083458, + "eval_loss": 0.6659091114997864, + "eval_mean_token_accuracy": 0.8504848906467127, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.5855, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 2360 + }, + { + "entropy": 0.21678635366261007, + "epoch": 5.921544209215442, + "grad_norm": 0.570612907409668, + "learning_rate": 9.669357652207635e-05, + "loss": 0.14821385145187377, + "mean_token_accuracy": 0.9503940217196941, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3322022325077722, + "eval_loss": 0.6722489595413208, + "eval_mean_token_accuracy": 0.8489979422369669, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.2986, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 2380 + }, + { + "entropy": 0.20932920072227718, + "epoch": 5.971357409713574, + "grad_norm": 0.7879557609558105, + "learning_rate": 9.475218688262262e-05, + "loss": 0.14675841331481934, + "mean_token_accuracy": 0.9507176131010056, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.3199348642902319, + "eval_loss": 0.6698136329650879, + "eval_mean_token_accuracy": 0.8514142130003419, + "eval_num_tokens": 5605400.0, + "eval_runtime": 85.8995, + "eval_samples_per_second": 16.007, + "eval_steps_per_second": 2.002, + "step": 2400 + }, + { + "entropy": 0.21032143919131693, + "epoch": 6.019925280199253, + "grad_norm": 0.5823076367378235, + "learning_rate": 9.281634267491569e-05, + "loss": 0.13322267532348633, + "mean_token_accuracy": 0.9550939072401096, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.30206270117399303, + "eval_loss": 0.7093168497085571, + "eval_mean_token_accuracy": 0.8500627639681794, + "eval_num_tokens": 5648968.0, + "eval_runtime": 85.8128, + "eval_samples_per_second": 16.023, + "eval_steps_per_second": 2.004, + "step": 2420 + }, + { + "entropy": 0.1534628233872354, + "epoch": 6.069738480697385, + "grad_norm": 0.710133969783783, + "learning_rate": 9.088662772316508e-05, + "loss": 0.09078952670097351, + "mean_token_accuracy": 0.9678447999060154, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.28208133101809857, + "eval_loss": 0.7636417150497437, + "eval_mean_token_accuracy": 0.8494061477655588, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9724, + "eval_samples_per_second": 15.994, + "eval_steps_per_second": 2.001, + "step": 2440 + }, + { + "entropy": 0.16151462448760867, + "epoch": 6.119551681195516, + "grad_norm": 0.5793812274932861, + "learning_rate": 8.896362400308028e-05, + "loss": 0.09545697569847107, + "mean_token_accuracy": 0.9671573750674725, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.2833245605403601, + "eval_loss": 0.7402405738830566, + "eval_mean_token_accuracy": 0.8503523728875226, + "eval_num_tokens": 5745090.0, + "eval_runtime": 85.5461, + "eval_samples_per_second": 16.073, + "eval_steps_per_second": 2.011, + "step": 2460 + }, + { + "entropy": 0.15203177919611335, + "epoch": 6.169364881693649, + "grad_norm": 0.4251123368740082, + "learning_rate": 8.704791146635483e-05, + "loss": 0.09420782327651978, + "mean_token_accuracy": 0.9677386932075024, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.28572545962971313, + "eval_loss": 0.735416829586029, + "eval_mean_token_accuracy": 0.8487084663884584, + "eval_num_tokens": 5790333.0, + "eval_runtime": 85.4801, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.012, + "step": 2480 + }, + { + "entropy": 0.15587336672469973, + "epoch": 6.219178082191781, + "grad_norm": 0.4357028007507324, + "learning_rate": 8.514006786576085e-05, + "loss": 0.09429320096969604, + "mean_token_accuracy": 0.9682952925562859, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.2859006894882335, + "eval_loss": 0.7347224950790405, + "eval_mean_token_accuracy": 0.8501905518215757, + "eval_num_tokens": 5837321.0, + "eval_runtime": 85.7578, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.006, + "step": 2500 + }, + { + "entropy": 0.15765639198943973, + "epoch": 6.268991282689913, + "grad_norm": 0.47331130504608154, + "learning_rate": 8.324066858090663e-05, + "loss": 0.09571113586425781, + "mean_token_accuracy": 0.9683481335639954, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.29231513846059176, + "eval_loss": 0.7392512559890747, + "eval_mean_token_accuracy": 0.8486633983462356, + "eval_num_tokens": 5884398.0, + "eval_runtime": 85.7846, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.005, + "step": 2520 + }, + { + "entropy": 0.16176860257983208, + "epoch": 6.318804483188045, + "grad_norm": 0.6142018437385559, + "learning_rate": 8.135028644470992e-05, + "loss": 0.09486144185066223, + "mean_token_accuracy": 0.9682316601276397, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.2851274753379267, + "eval_loss": 0.7520816922187805, + "eval_mean_token_accuracy": 0.8501113649717597, + "eval_num_tokens": 5929876.0, + "eval_runtime": 85.9425, + "eval_samples_per_second": 15.999, + "eval_steps_per_second": 2.001, + "step": 2540 + }, + { + "entropy": 0.15404034564271568, + "epoch": 6.3686176836861765, + "grad_norm": 0.6051287651062012, + "learning_rate": 7.946949157063964e-05, + "loss": 0.09280472993850708, + "mean_token_accuracy": 0.9684635892510414, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28802703563557114, + "eval_loss": 0.7439162135124207, + "eval_mean_token_accuracy": 0.8499851770872293, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.0703, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.998, + "step": 2560 + }, + { + "entropy": 0.15343588953837753, + "epoch": 6.418430884184309, + "grad_norm": 0.4823743402957916, + "learning_rate": 7.759885118077701e-05, + "loss": 0.09000591039657593, + "mean_token_accuracy": 0.9699928767979145, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2795634938533916, + "eval_loss": 0.7647850513458252, + "eval_mean_token_accuracy": 0.8503464397995971, + "eval_num_tokens": 6025380.0, + "eval_runtime": 85.8886, + "eval_samples_per_second": 16.009, + "eval_steps_per_second": 2.003, + "step": 2580 + }, + { + "entropy": 0.15740026142448188, + "epoch": 6.468244084682441, + "grad_norm": 0.5082696676254272, + "learning_rate": 7.57389294347494e-05, + "loss": 0.09191849827766418, + "mean_token_accuracy": 0.9692809768021107, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2913342311458532, + "eval_loss": 0.7518694996833801, + "eval_mean_token_accuracy": 0.8483168302580367, + "eval_num_tokens": 6073349.0, + "eval_runtime": 85.5761, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.01, + "step": 2600 + }, + { + "entropy": 0.15922069251537324, + "epoch": 6.518057285180573, + "grad_norm": 0.3995199501514435, + "learning_rate": 7.389028725958736e-05, + "loss": 0.09584367871284485, + "mean_token_accuracy": 0.9685114495456218, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.2863075934177221, + "eval_loss": 0.7539381384849548, + "eval_mean_token_accuracy": 0.8507507083027862, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.112, + "eval_samples_per_second": 15.968, + "eval_steps_per_second": 1.997, + "step": 2620 + }, + { + "entropy": 0.16197575423866512, + "epoch": 6.567870485678705, + "grad_norm": 0.534295380115509, + "learning_rate": 7.205348218055678e-05, + "loss": 0.0961170256137848, + "mean_token_accuracy": 0.9674530044198036, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.29021967315050057, + "eval_loss": 0.751198947429657, + "eval_mean_token_accuracy": 0.8509796344956686, + "eval_num_tokens": 6165523.0, + "eval_runtime": 85.7958, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.005, + "step": 2640 + }, + { + "entropy": 0.15261746793985367, + "epoch": 6.617683686176837, + "grad_norm": 0.5391237139701843, + "learning_rate": 7.022906815301673e-05, + "loss": 0.0926026999950409, + "mean_token_accuracy": 0.9695659473538398, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.29128045216202736, + "eval_loss": 0.7450292110443115, + "eval_mean_token_accuracy": 0.8498771443616512, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.3963, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 2660 + }, + { + "entropy": 0.16164180357009172, + "epoch": 6.667496886674969, + "grad_norm": 0.5767946243286133, + "learning_rate": 6.841759539535419e-05, + "loss": 0.09291981458663941, + "mean_token_accuracy": 0.9687136687338352, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2897637223088464, + "eval_loss": 0.7503410577774048, + "eval_mean_token_accuracy": 0.8503315164599308, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.0653, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.998, + "step": 2680 + }, + { + "entropy": 0.17062523355707526, + "epoch": 6.717310087173101, + "grad_norm": 0.4974168539047241, + "learning_rate": 6.661961022304563e-05, + "loss": 0.09713236689567566, + "mean_token_accuracy": 0.9661971725523472, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2765843396963075, + "eval_loss": 0.7604002356529236, + "eval_mean_token_accuracy": 0.8521115277395692, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.1676, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 2700 + }, + { + "entropy": 0.17544092936441302, + "epoch": 6.767123287671232, + "grad_norm": 0.5523537993431091, + "learning_rate": 6.483565488389582e-05, + "loss": 0.09709116220474243, + "mean_token_accuracy": 0.9650957375764847, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.27939334659035814, + "eval_loss": 0.7534670829772949, + "eval_mean_token_accuracy": 0.851230604010959, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.2913, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 2720 + }, + { + "entropy": 0.15991022661328316, + "epoch": 6.816936488169365, + "grad_norm": 0.478551983833313, + "learning_rate": 6.306626739450311e-05, + "loss": 0.09564646482467651, + "mean_token_accuracy": 0.9679084822535515, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.27878295491601146, + "eval_loss": 0.7519959211349487, + "eval_mean_token_accuracy": 0.8510654949864676, + "eval_num_tokens": 6397720.0, + "eval_runtime": 85.9109, + "eval_samples_per_second": 16.005, + "eval_steps_per_second": 2.002, + "step": 2740 + }, + { + "entropy": 0.16824879590421915, + "epoch": 6.866749688667497, + "grad_norm": 0.6681098937988281, + "learning_rate": 6.131198137800108e-05, + "loss": 0.0962279736995697, + "mean_token_accuracy": 0.966830012947321, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.2834690434121808, + "eval_loss": 0.751922070980072, + "eval_mean_token_accuracy": 0.8521237577809844, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.3618, + "eval_samples_per_second": 15.921, + "eval_steps_per_second": 1.992, + "step": 2760 + }, + { + "entropy": 0.1518704930320382, + "epoch": 6.916562889165629, + "grad_norm": 0.5201290249824524, + "learning_rate": 5.957332590312513e-05, + "loss": 0.09010660648345947, + "mean_token_accuracy": 0.9693463340401649, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.28485129617674404, + "eval_loss": 0.7452457547187805, + "eval_mean_token_accuracy": 0.8512036796919135, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.4524, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.99, + "step": 2780 + }, + { + "entropy": 0.15512610590085388, + "epoch": 6.966376089663761, + "grad_norm": 0.42802050709724426, + "learning_rate": 5.785082532465233e-05, + "loss": 0.09320432543754578, + "mean_token_accuracy": 0.9686134628951549, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.27554594526110693, + "eval_loss": 0.7644653916358948, + "eval_mean_token_accuracy": 0.8513738523389018, + "eval_num_tokens": 6540175.0, + "eval_runtime": 85.7609, + "eval_samples_per_second": 16.033, + "eval_steps_per_second": 2.006, + "step": 2800 + }, + { + "entropy": 0.17524497526196334, + "epoch": 7.01494396014944, + "grad_norm": 0.3330269157886505, + "learning_rate": 5.6144999125263545e-05, + "loss": 0.0895616888999939, + "mean_token_accuracy": 0.9682766932707566, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.2735865569218647, + "eval_loss": 0.768479585647583, + "eval_mean_token_accuracy": 0.8503459383581959, + "eval_num_tokens": 6583767.0, + "eval_runtime": 85.7162, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.007, + "step": 2820 + }, + { + "entropy": 0.1403565663844347, + "epoch": 7.064757160647572, + "grad_norm": 0.35613498091697693, + "learning_rate": 5.4456361758874235e-05, + "loss": 0.07551313638687134, + "mean_token_accuracy": 0.9739301167428493, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.25941789089593775, + "eval_loss": 0.8209511637687683, + "eval_mean_token_accuracy": 0.8505055855873019, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.0943, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 2840 + }, + { + "entropy": 0.13500106502324344, + "epoch": 7.114570361145703, + "grad_norm": 0.34418627619743347, + "learning_rate": 5.2785422495482234e-05, + "loss": 0.07293946146965027, + "mean_token_accuracy": 0.9747208289802074, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.26482899772912954, + "eval_loss": 0.798904538154602, + "eval_mean_token_accuracy": 0.8511530233677044, + "eval_num_tokens": 6672946.0, + "eval_runtime": 85.7915, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.005, + "step": 2860 + }, + { + "entropy": 0.13127502552233636, + "epoch": 7.164383561643835, + "grad_norm": 0.4638441503047943, + "learning_rate": 5.113268526757892e-05, + "loss": 0.07121461629867554, + "mean_token_accuracy": 0.9756786689162255, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2645381211714689, + "eval_loss": 0.809101939201355, + "eval_mean_token_accuracy": 0.8514727898115335, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.84, + "eval_samples_per_second": 16.018, + "eval_steps_per_second": 2.004, + "step": 2880 + }, + { + "entropy": 0.1331390908919275, + "epoch": 7.214196762141968, + "grad_norm": 0.40206775069236755, + "learning_rate": 4.949864851817007e-05, + "loss": 0.07188264131546021, + "mean_token_accuracy": 0.9755406074225903, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.26244733283339544, + "eval_loss": 0.8143188953399658, + "eval_mean_token_accuracy": 0.8514358189909957, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.8546, + "eval_samples_per_second": 16.015, + "eval_steps_per_second": 2.003, + "step": 2900 + }, + { + "entropy": 0.13647331558167936, + "epoch": 7.2640099626401, + "grad_norm": 0.26405787467956543, + "learning_rate": 4.788380505045224e-05, + "loss": 0.07412450313568116, + "mean_token_accuracy": 0.9744274213910102, + "num_tokens": 6809678.0, + "step": 2920 + }, + { + "epoch": 7.2640099626401, + "eval_entropy": 0.2626111418182074, + "eval_loss": 0.8111525177955627, + "eval_mean_token_accuracy": 0.8512121695418691, + "eval_num_tokens": 6809678.0, + "eval_runtime": 85.9626, + "eval_samples_per_second": 15.995, + "eval_steps_per_second": 2.001, + "step": 2920 + }, + { + "entropy": 0.12644002586603165, + "epoch": 7.313823163138232, + "grad_norm": 0.27514681220054626, + "learning_rate": 4.6288641879189884e-05, + "loss": 0.06807711124420165, + "mean_token_accuracy": 0.9760703906416893, + "num_tokens": 6860750.0, + "step": 2940 + }, + { + "epoch": 7.313823163138232, + "eval_entropy": 0.26096762734097106, + "eval_loss": 0.8184595108032227, + "eval_mean_token_accuracy": 0.8501476153384807, + "eval_num_tokens": 6860750.0, + "eval_runtime": 85.9521, + "eval_samples_per_second": 15.997, + "eval_steps_per_second": 2.001, + "step": 2940 + }, + { + "entropy": 0.13920630998909472, + "epoch": 7.363636363636363, + "grad_norm": 0.23584705591201782, + "learning_rate": 4.4713640083838604e-05, + "loss": 0.07301607131958007, + "mean_token_accuracy": 0.9745715200901032, + "num_tokens": 6907092.0, + "step": 2960 + }, + { + "epoch": 7.363636363636363, + "eval_entropy": 0.2612536767021168, + "eval_loss": 0.8116245269775391, + "eval_mean_token_accuracy": 0.8510967350976412, + "eval_num_tokens": 6907092.0, + "eval_runtime": 85.6373, + "eval_samples_per_second": 16.056, + "eval_steps_per_second": 2.008, + "step": 2960 + }, + { + "entropy": 0.1349492883309722, + "epoch": 7.4134495641344955, + "grad_norm": 0.24552719295024872, + "learning_rate": 4.315927466345791e-05, + "loss": 0.07397544980049134, + "mean_token_accuracy": 0.9745095103979111, + "num_tokens": 6952700.0, + "step": 2980 + }, + { + "epoch": 7.4134495641344955, + "eval_entropy": 0.25796533306670744, + "eval_loss": 0.8266491293907166, + "eval_mean_token_accuracy": 0.8511653857868772, + "eval_num_tokens": 6952700.0, + "eval_runtime": 85.7462, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.006, + "step": 2980 + }, + { + "entropy": 0.14479175000451505, + "epoch": 7.463262764632628, + "grad_norm": 0.2846072018146515, + "learning_rate": 4.162601439345814e-05, + "loss": 0.07544798254966736, + "mean_token_accuracy": 0.9727819666266442, + "num_tokens": 6996430.0, + "step": 3000 + }, + { + "epoch": 7.463262764632628, + "eval_entropy": 0.2584348309698493, + "eval_loss": 0.8253348469734192, + "eval_mean_token_accuracy": 0.8511569815319638, + "eval_num_tokens": 6996430.0, + "eval_runtime": 86.2984, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 3000 + }, + { + "entropy": 0.14114196319133043, + "epoch": 7.51307596513076, + "grad_norm": 0.407966285943985, + "learning_rate": 4.011432168422419e-05, + "loss": 0.0736398994922638, + "mean_token_accuracy": 0.9741654269397259, + "num_tokens": 7042038.0, + "step": 3020 + }, + { + "epoch": 7.51307596513076, + "eval_entropy": 0.25232676260693127, + "eval_loss": 0.8296052813529968, + "eval_mean_token_accuracy": 0.8523298349491385, + "eval_num_tokens": 7042038.0, + "eval_runtime": 85.8445, + "eval_samples_per_second": 16.017, + "eval_steps_per_second": 2.004, + "step": 3020 + }, + { + "entropy": 0.1353456223383546, + "epoch": 7.562889165628892, + "grad_norm": 0.2712634801864624, + "learning_rate": 3.8624652441658684e-05, + "loss": 0.07362412214279175, + "mean_token_accuracy": 0.9747945807874203, + "num_tokens": 7089390.0, + "step": 3040 + }, + { + "epoch": 7.562889165628892, + "eval_entropy": 0.2579477243991785, + "eval_loss": 0.8274564743041992, + "eval_mean_token_accuracy": 0.8517705212498821, + "eval_num_tokens": 7089390.0, + "eval_runtime": 85.8222, + "eval_samples_per_second": 16.022, + "eval_steps_per_second": 2.004, + "step": 3040 + }, + { + "entropy": 0.1296080862637609, + "epoch": 7.6127023661270234, + "grad_norm": 0.2371893972158432, + "learning_rate": 3.715745592968707e-05, + "loss": 0.06971035599708557, + "mean_token_accuracy": 0.9759043246507645, + "num_tokens": 7138002.0, + "step": 3060 + }, + { + "epoch": 7.6127023661270234, + "eval_entropy": 0.25391967083479083, + "eval_loss": 0.8197130560874939, + "eval_mean_token_accuracy": 0.8522267875283264, + "eval_num_tokens": 7138002.0, + "eval_runtime": 85.8796, + "eval_samples_per_second": 16.011, + "eval_steps_per_second": 2.003, + "step": 3060 + }, + { + "entropy": 0.1311203008517623, + "epoch": 7.662515566625156, + "grad_norm": 0.22499267756938934, + "learning_rate": 3.5713174634765967e-05, + "loss": 0.07176244258880615, + "mean_token_accuracy": 0.9754939571022987, + "num_tokens": 7185520.0, + "step": 3080 + }, + { + "epoch": 7.662515566625156, + "eval_entropy": 0.2526215241225653, + "eval_loss": 0.8265154361724854, + "eval_mean_token_accuracy": 0.8519952584837758, + "eval_num_tokens": 7185520.0, + "eval_runtime": 85.8746, + "eval_samples_per_second": 16.012, + "eval_steps_per_second": 2.003, + "step": 3080 + }, + { + "entropy": 0.13420484317466616, + "epoch": 7.712328767123288, + "grad_norm": 0.2398064285516739, + "learning_rate": 3.4292244132434866e-05, + "loss": 0.07559212446212768, + "mean_token_accuracy": 0.9743142127990723, + "num_tokens": 7232170.0, + "step": 3100 + }, + { + "epoch": 7.712328767123288, + "eval_entropy": 0.2484562756537005, + "eval_loss": 0.8312150239944458, + "eval_mean_token_accuracy": 0.8528405119513356, + "eval_num_tokens": 7232170.0, + "eval_runtime": 85.7896, + "eval_samples_per_second": 16.028, + "eval_steps_per_second": 2.005, + "step": 3100 + }, + { + "entropy": 0.11965563679113984, + "epoch": 7.76214196762142, + "grad_norm": 0.3408384919166565, + "learning_rate": 3.2895092955952746e-05, + "loss": 0.0661750853061676, + "mean_token_accuracy": 0.9776600524783134, + "num_tokens": 7282846.0, + "step": 3120 + }, + { + "epoch": 7.76214196762142, + "eval_entropy": 0.2522421533804993, + "eval_loss": 0.8327009677886963, + "eval_mean_token_accuracy": 0.8524222023958383, + "eval_num_tokens": 7282846.0, + "eval_runtime": 86.1769, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 1.996, + "step": 3120 + }, + { + "entropy": 0.13388084415346385, + "epoch": 7.811955168119551, + "grad_norm": 0.35418516397476196, + "learning_rate": 3.152214246705829e-05, + "loss": 0.07149899601936341, + "mean_token_accuracy": 0.9747635535895824, + "num_tokens": 7331518.0, + "step": 3140 + }, + { + "epoch": 7.811955168119551, + "eval_entropy": 0.25038352296795957, + "eval_loss": 0.836457371711731, + "eval_mean_token_accuracy": 0.8526130665180295, + "eval_num_tokens": 7331518.0, + "eval_runtime": 85.6099, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.009, + "step": 3140 + }, + { + "entropy": 0.13530643959529698, + "epoch": 7.861768368617684, + "grad_norm": 0.38060539960861206, + "learning_rate": 3.017380672889291e-05, + "loss": 0.07116585969924927, + "mean_token_accuracy": 0.973284512758255, + "num_tokens": 7379056.0, + "step": 3160 + }, + { + "epoch": 7.861768368617684, + "eval_entropy": 0.255092611319797, + "eval_loss": 0.8314701914787292, + "eval_mean_token_accuracy": 0.8520913099826768, + "eval_num_tokens": 7379056.0, + "eval_runtime": 85.877, + "eval_samples_per_second": 16.011, + "eval_steps_per_second": 2.003, + "step": 3160 + }, + { + "entropy": 0.13383390177041293, + "epoch": 7.911581569115816, + "grad_norm": 0.3827536106109619, + "learning_rate": 2.8850492381124808e-05, + "loss": 0.07305437326431274, + "mean_token_accuracy": 0.9750778004527092, + "num_tokens": 7424770.0, + "step": 3180 + }, + { + "epoch": 7.911581569115816, + "eval_entropy": 0.25416371157003004, + "eval_loss": 0.8206402063369751, + "eval_mean_token_accuracy": 0.852779901651449, + "eval_num_tokens": 7424770.0, + "eval_runtime": 86.1015, + "eval_samples_per_second": 15.97, + "eval_steps_per_second": 1.998, + "step": 3180 + }, + { + "entropy": 0.1395680439658463, + "epoch": 7.961394769613948, + "grad_norm": 0.3809775412082672, + "learning_rate": 2.7552598517312256e-05, + "loss": 0.07236042022705078, + "mean_token_accuracy": 0.9731538116931915, + "num_tokens": 7470804.0, + "step": 3200 + }, + { + "epoch": 7.961394769613948, + "eval_entropy": 0.25528111975899964, + "eval_loss": 0.8230037093162537, + "eval_mean_token_accuracy": 0.8526452603035195, + "eval_num_tokens": 7470804.0, + "eval_runtime": 85.7895, + "eval_samples_per_second": 16.028, + "eval_steps_per_second": 2.005, + "step": 3200 + }, + { + "entropy": 0.12193699864049752, + "epoch": 8.009962640099626, + "grad_norm": 0.11854425817728043, + "learning_rate": 2.6280516564542205e-05, + "loss": 0.06617764234542847, + "mean_token_accuracy": 0.977179691577569, + "num_tokens": 7518110.0, + "step": 3220 + }, + { + "epoch": 8.009962640099626, + "eval_entropy": 0.25100527677771656, + "eval_loss": 0.8393343687057495, + "eval_mean_token_accuracy": 0.8522553132023922, + "eval_num_tokens": 7518110.0, + "eval_runtime": 85.8837, + "eval_samples_per_second": 16.01, + "eval_steps_per_second": 2.003, + "step": 3220 + }, + { + "entropy": 0.12788885813206435, + "epoch": 8.059775840597759, + "grad_norm": 0.16094881296157837, + "learning_rate": 2.50346301653812e-05, + "loss": 0.06274186968803405, + "mean_token_accuracy": 0.9766994707286358, + "num_tokens": 7565539.0, + "step": 3240 + }, + { + "epoch": 8.059775840597759, + "eval_entropy": 0.24409458682287571, + "eval_loss": 0.874617338180542, + "eval_mean_token_accuracy": 0.8521041180505309, + "eval_num_tokens": 7565539.0, + "eval_runtime": 86.2656, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 3240 + }, + { + "entropy": 0.12464155335910618, + "epoch": 8.10958904109589, + "grad_norm": 0.16893954575061798, + "learning_rate": 2.381531506217437e-05, + "loss": 0.06093020439147949, + "mean_token_accuracy": 0.9776258453726768, + "num_tokens": 7612578.0, + "step": 3260 + }, + { + "epoch": 8.10958904109589, + "eval_entropy": 0.24396493017326953, + "eval_loss": 0.891161322593689, + "eval_mean_token_accuracy": 0.8515338024427724, + "eval_num_tokens": 7612578.0, + "eval_runtime": 85.9061, + "eval_samples_per_second": 16.006, + "eval_steps_per_second": 2.002, + "step": 3260 + }, + { + "entropy": 0.12345920228399336, + "epoch": 8.159402241594023, + "grad_norm": 0.14332273602485657, + "learning_rate": 2.262293898372616e-05, + "loss": 0.061289966106414795, + "mean_token_accuracy": 0.9762230902910233, + "num_tokens": 7660157.0, + "step": 3280 + }, + { + "epoch": 8.159402241594023, + "eval_entropy": 0.2481445314059424, + "eval_loss": 0.8922848105430603, + "eval_mean_token_accuracy": 0.8514944855556932, + "eval_num_tokens": 7660157.0, + "eval_runtime": 85.5201, + "eval_samples_per_second": 16.078, + "eval_steps_per_second": 2.011, + "step": 3280 + }, + { + "entropy": 0.12298110066913068, + "epoch": 8.209215442092155, + "grad_norm": 0.21848882734775543, + "learning_rate": 2.1457861534398633e-05, + "loss": 0.05986443758010864, + "mean_token_accuracy": 0.9786281704902648, + "num_tokens": 7709745.0, + "step": 3300 + }, + { + "epoch": 8.209215442092155, + "eval_entropy": 0.24329388124305149, + "eval_loss": 0.9021085500717163, + "eval_mean_token_accuracy": 0.8521762625422589, + "eval_num_tokens": 7709745.0, + "eval_runtime": 85.955, + "eval_samples_per_second": 15.997, + "eval_steps_per_second": 2.001, + "step": 3300 + }, + { + "entropy": 0.13265180448070168, + "epoch": 8.259028642590286, + "grad_norm": 0.18067947030067444, + "learning_rate": 2.0320434085659692e-05, + "loss": 0.06724961400032044, + "mean_token_accuracy": 0.975098168104887, + "num_tokens": 7753571.0, + "step": 3320 + }, + { + "epoch": 8.259028642590286, + "eval_entropy": 0.2433211464694766, + "eval_loss": 0.9094350337982178, + "eval_mean_token_accuracy": 0.8520150094531304, + "eval_num_tokens": 7753571.0, + "eval_runtime": 85.7989, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.005, + "step": 3320 + }, + { + "entropy": 0.11949320202693343, + "epoch": 8.308841843088418, + "grad_norm": 0.17020289599895477, + "learning_rate": 1.9210999670114196e-05, + "loss": 0.0634455680847168, + "mean_token_accuracy": 0.9771294385194779, + "num_tokens": 7799310.0, + "step": 3340 + }, + { + "epoch": 8.308841843088418, + "eval_entropy": 0.24345201219237128, + "eval_loss": 0.9021793603897095, + "eval_mean_token_accuracy": 0.8520745697409607, + "eval_num_tokens": 7799310.0, + "eval_runtime": 86.0883, + "eval_samples_per_second": 15.972, + "eval_steps_per_second": 1.998, + "step": 3340 + }, + { + "entropy": 0.12065747743472457, + "epoch": 8.35865504358655, + "grad_norm": 0.16789060831069946, + "learning_rate": 1.8129892878049886e-05, + "loss": 0.061494195461273195, + "mean_token_accuracy": 0.9779584899544715, + "num_tokens": 7846447.0, + "step": 3360 + }, + { + "epoch": 8.35865504358655, + "eval_entropy": 0.24093415042342142, + "eval_loss": 0.9006755352020264, + "eval_mean_token_accuracy": 0.852174230786257, + "eval_num_tokens": 7846447.0, + "eval_runtime": 85.9011, + "eval_samples_per_second": 16.007, + "eval_steps_per_second": 2.002, + "step": 3360 + }, + { + "entropy": 0.13125578537583352, + "epoch": 8.408468244084682, + "grad_norm": 0.1662452220916748, + "learning_rate": 1.70774397565298e-05, + "loss": 0.06685600876808166, + "mean_token_accuracy": 0.9744067586958408, + "num_tokens": 7890283.0, + "step": 3380 + }, + { + "epoch": 8.408468244084682, + "eval_entropy": 0.24062153688350388, + "eval_loss": 0.9078915119171143, + "eval_mean_token_accuracy": 0.8523201647886011, + "eval_num_tokens": 7890283.0, + "eval_runtime": 86.0201, + "eval_samples_per_second": 15.985, + "eval_steps_per_second": 2.0, + "step": 3380 + }, + { + "entropy": 0.11986117120832204, + "epoch": 8.458281444582815, + "grad_norm": 0.19571948051452637, + "learning_rate": 1.6053957711060606e-05, + "loss": 0.06411095261573792, + "mean_token_accuracy": 0.9770627245306969, + "num_tokens": 7936518.0, + "step": 3400 + }, + { + "epoch": 8.458281444582815, + "eval_entropy": 0.24352820347561394, + "eval_loss": 0.9058943390846252, + "eval_mean_token_accuracy": 0.8519382792156797, + "eval_num_tokens": 7936518.0, + "eval_runtime": 85.966, + "eval_samples_per_second": 15.995, + "eval_steps_per_second": 2.001, + "step": 3400 + }, + { + "entropy": 0.12857897616922856, + "epoch": 8.508094645080947, + "grad_norm": 0.2609264850616455, + "learning_rate": 1.5059755409867613e-05, + "loss": 0.06473397612571716, + "mean_token_accuracy": 0.9764650195837021, + "num_tokens": 7981966.0, + "step": 3420 + }, + { + "epoch": 8.508094645080947, + "eval_entropy": 0.24032609000108962, + "eval_loss": 0.9077776074409485, + "eval_mean_token_accuracy": 0.8517829197090726, + "eval_num_tokens": 7981966.0, + "eval_runtime": 86.6059, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 3420 + }, + { + "entropy": 0.12348870886489749, + "epoch": 8.557907845579079, + "grad_norm": 0.19537609815597534, + "learning_rate": 1.409513269080473e-05, + "loss": 0.06481348872184753, + "mean_token_accuracy": 0.9769559659063816, + "num_tokens": 8028367.0, + "step": 3440 + }, + { + "epoch": 8.557907845579079, + "eval_entropy": 0.2404322574824788, + "eval_loss": 0.9057720899581909, + "eval_mean_token_accuracy": 0.8521037981953732, + "eval_num_tokens": 8028367.0, + "eval_runtime": 86.166, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.996, + "step": 3440 + }, + { + "entropy": 0.12040232736617326, + "epoch": 8.607721046077211, + "grad_norm": 0.3310582935810089, + "learning_rate": 1.3160380470927183e-05, + "loss": 0.06468871235847473, + "mean_token_accuracy": 0.9768650442361831, + "num_tokens": 8074934.0, + "step": 3460 + }, + { + "epoch": 8.607721046077211, + "eval_entropy": 0.24118655876711356, + "eval_loss": 0.9028318524360657, + "eval_mean_token_accuracy": 0.8521025340224422, + "eval_num_tokens": 8074934.0, + "eval_runtime": 85.3668, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.015, + "step": 3460 + }, + { + "entropy": 0.12328103906475008, + "epoch": 8.657534246575342, + "grad_norm": 0.12836167216300964, + "learning_rate": 1.2255780658755122e-05, + "loss": 0.06229386329650879, + "mean_token_accuracy": 0.9763277888298034, + "num_tokens": 8122775.0, + "step": 3480 + }, + { + "epoch": 8.657534246575342, + "eval_entropy": 0.24194598145956217, + "eval_loss": 0.9009329080581665, + "eval_mean_token_accuracy": 0.8521693289973015, + "eval_num_tokens": 8122775.0, + "eval_runtime": 85.9415, + "eval_samples_per_second": 15.999, + "eval_steps_per_second": 2.001, + "step": 3480 + }, + { + "entropy": 0.11321646976284683, + "epoch": 8.707347447073474, + "grad_norm": 0.15656894445419312, + "learning_rate": 1.1381606069253786e-05, + "loss": 0.05908188819885254, + "mean_token_accuracy": 0.9779504477977753, + "num_tokens": 8174307.0, + "step": 3500 + }, + { + "epoch": 8.707347447073474, + "eval_entropy": 0.24121542517528977, + "eval_loss": 0.9016091823577881, + "eval_mean_token_accuracy": 0.8521790667328724, + "eval_num_tokens": 8174307.0, + "eval_runtime": 85.7465, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.006, + "step": 3500 + }, + { + "entropy": 0.12657046681270004, + "epoch": 8.757160647571606, + "grad_norm": 0.22597502171993256, + "learning_rate": 1.053812034155629e-05, + "loss": 0.06244581937789917, + "mean_token_accuracy": 0.976795207709074, + "num_tokens": 8222808.0, + "step": 3520 + }, + { + "epoch": 8.757160647571606, + "eval_entropy": 0.23877542708502258, + "eval_loss": 0.9069110155105591, + "eval_mean_token_accuracy": 0.8522880177858264, + "eval_num_tokens": 8222808.0, + "eval_runtime": 85.7792, + "eval_samples_per_second": 16.03, + "eval_steps_per_second": 2.005, + "step": 3520 + }, + { + "entropy": 0.11422101808711886, + "epoch": 8.806973848069738, + "grad_norm": 0.21139323711395264, + "learning_rate": 9.725577859453502e-06, + "loss": 0.05988085865974426, + "mean_token_accuracy": 0.9779510758817196, + "num_tokens": 8273335.0, + "step": 3540 + }, + { + "epoch": 8.806973848069738, + "eval_entropy": 0.2393161087881687, + "eval_loss": 0.9033801555633545, + "eval_mean_token_accuracy": 0.8522614209457885, + "eval_num_tokens": 8273335.0, + "eval_runtime": 85.5594, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 3540 + }, + { + "entropy": 0.13810604228638113, + "epoch": 8.85678704856787, + "grad_norm": 0.24571993947029114, + "learning_rate": 8.944223674675537e-06, + "loss": 0.07036117911338806, + "mean_token_accuracy": 0.9734892748296261, + "num_tokens": 8315235.0, + "step": 3560 + }, + { + "epoch": 8.85678704856787, + "eval_entropy": 0.23998506947658782, + "eval_loss": 0.9009848833084106, + "eval_mean_token_accuracy": 0.8521793619837872, + "eval_num_tokens": 8315235.0, + "eval_runtime": 86.0974, + "eval_samples_per_second": 15.97, + "eval_steps_per_second": 1.998, + "step": 3560 + }, + { + "entropy": 0.14193559321574867, + "epoch": 8.906600249066003, + "grad_norm": 0.17304112017154694, + "learning_rate": 8.194293432987386e-06, + "loss": 0.07077967524528503, + "mean_token_accuracy": 0.973305893689394, + "num_tokens": 8358099.0, + "step": 3580 + }, + { + "epoch": 8.906600249066003, + "eval_entropy": 0.23883876689644748, + "eval_loss": 0.9015622138977051, + "eval_mean_token_accuracy": 0.8524864378363587, + "eval_num_tokens": 8358099.0, + "eval_runtime": 86.0089, + "eval_samples_per_second": 15.987, + "eval_steps_per_second": 2.0, + "step": 3580 + }, + { + "entropy": 0.11878943420015275, + "epoch": 8.956413449564135, + "grad_norm": 0.19075658917427063, + "learning_rate": 7.476013303121426e-06, + "loss": 0.060806107521057126, + "mean_token_accuracy": 0.9776863709092141, + "num_tokens": 8407430.0, + "step": 3600 + }, + { + "epoch": 8.956413449564135, + "eval_entropy": 0.23726526309931, + "eval_loss": 0.9060276746749878, + "eval_mean_token_accuracy": 0.8524192058762838, + "eval_num_tokens": 8407430.0, + "eval_runtime": 85.7252, + "eval_samples_per_second": 16.04, + "eval_steps_per_second": 2.006, + "step": 3600 + }, + { + "entropy": 0.1255835090787747, + "epoch": 9.004981320049813, + "grad_norm": 0.11608047038316727, + "learning_rate": 6.78959990856799e-06, + "loss": 0.06319612860679627, + "mean_token_accuracy": 0.9766685519462976, + "num_tokens": 8453175.0, + "step": 3620 + }, + { + "epoch": 9.004981320049813, + "eval_entropy": 0.2373251837006835, + "eval_loss": 0.9045722484588623, + "eval_mean_token_accuracy": 0.8525558363559634, + "eval_num_tokens": 8453175.0, + "eval_runtime": 85.7435, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.006, + "step": 3620 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.5680073186620416e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3640/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3640/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3640/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3640/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3640/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3640/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3640/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3640/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3640/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3640/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3640/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3640/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3640/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3640/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..da92f8a3cc8d5d17652922599e6a9560c7717414 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3640/trainer_state.json @@ -0,0 +1,3856 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 9.054794520547945, + "eval_steps": 20, + "global_step": 3640, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + }, + { + "entropy": 0.561330484598875, + "epoch": 1.891656288916563, + "grad_norm": 0.6722865700721741, + "learning_rate": 0.0002208867897174789, + "loss": 0.499837589263916, + "mean_token_accuracy": 0.8518734864890576, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.5865232653396074, + "eval_loss": 0.5437926650047302, + "eval_mean_token_accuracy": 0.8450997017843779, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4116, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.547389242425561, + "epoch": 1.9414694894146949, + "grad_norm": 0.7935577034950256, + "learning_rate": 0.00022027119820226907, + "loss": 0.4977591514587402, + "mean_token_accuracy": 0.8539491161704064, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.5290903090391048, + "eval_loss": 0.5409526824951172, + "eval_mean_token_accuracy": 0.8497545698354411, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.7262, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 780 + }, + { + "entropy": 0.5687909748405218, + "epoch": 1.9912826899128269, + "grad_norm": 0.6180546283721924, + "learning_rate": 0.00021962329729698345, + "loss": 0.5109643459320068, + "mean_token_accuracy": 0.8521598495543004, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.5503541858390321, + "eval_loss": 0.5361555218696594, + "eval_mean_token_accuracy": 0.8510884285666221, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.3339, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 800 + }, + { + "entropy": 0.4739728841261986, + "epoch": 2.0398505603985058, + "grad_norm": 0.8058829307556152, + "learning_rate": 0.0002189432823996982, + "loss": 0.4204097747802734, + "mean_token_accuracy": 0.8728981889211215, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.5077334992414297, + "eval_loss": 0.5531114339828491, + "eval_mean_token_accuracy": 0.8489257208136625, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.4801, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.989, + "step": 820 + }, + { + "entropy": 0.4594309840351343, + "epoch": 2.0896637608966375, + "grad_norm": 0.6906896829605103, + "learning_rate": 0.0002182313585936314, + "loss": 0.4071959495544434, + "mean_token_accuracy": 0.8732857562601566, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.49850136994622474, + "eval_loss": 0.5486204624176025, + "eval_mean_token_accuracy": 0.8507991450470548, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.3364, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.4881629109382629, + "epoch": 2.1394769613947697, + "grad_norm": 0.6343470215797424, + "learning_rate": 0.0002174877405852928, + "loss": 0.41669540405273436, + "mean_token_accuracy": 0.8711295068264008, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.49155513924914734, + "eval_loss": 0.555109441280365, + "eval_mean_token_accuracy": 0.8496399400539176, + "eval_num_tokens": 2008562.0, + "eval_runtime": 86.3295, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 860 + }, + { + "entropy": 0.4648668970912695, + "epoch": 2.1892901618929015, + "grad_norm": 0.8014165163040161, + "learning_rate": 0.00021671265263973133, + "loss": 0.4110250473022461, + "mean_token_accuracy": 0.8754166305065155, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.4909258722219356, + "eval_loss": 0.5539511442184448, + "eval_mean_token_accuracy": 0.8492401502160138, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.3468, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 880 + }, + { + "entropy": 0.4824485514312983, + "epoch": 2.2391033623910337, + "grad_norm": 0.6665191054344177, + "learning_rate": 0.00021590632851289967, + "loss": 0.4181404113769531, + "mean_token_accuracy": 0.8726993151009083, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.4986876940657926, + "eval_loss": 0.547695517539978, + "eval_mean_token_accuracy": 0.8501384708770486, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.3838, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 900 + }, + { + "entropy": 0.4751896943897009, + "epoch": 2.2889165628891655, + "grad_norm": 0.81158047914505, + "learning_rate": 0.00021506901138115678, + "loss": 0.40689678192138673, + "mean_token_accuracy": 0.8745221219956875, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.507153491121392, + "eval_loss": 0.5501641631126404, + "eval_mean_token_accuracy": 0.8495670116918032, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.0912, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 920 + }, + { + "entropy": 0.4873133715242147, + "epoch": 2.3387297633872977, + "grad_norm": 0.7218056321144104, + "learning_rate": 0.0002142009537679292, + "loss": 0.42701358795166017, + "mean_token_accuracy": 0.8695114746689796, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5202612736543943, + "eval_loss": 0.5491839051246643, + "eval_mean_token_accuracy": 0.8494071208460386, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.1142, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 940 + }, + { + "entropy": 0.4762951169162989, + "epoch": 2.3885429638854294, + "grad_norm": 0.7194424867630005, + "learning_rate": 0.0002133024174675534, + "loss": 0.42299847602844237, + "mean_token_accuracy": 0.8709790132939815, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4899340462546016, + "eval_loss": 0.5522511601448059, + "eval_mean_token_accuracy": 0.8492208258357159, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.463, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 960 + }, + { + "entropy": 0.49650347977876663, + "epoch": 2.4383561643835616, + "grad_norm": 0.8406022787094116, + "learning_rate": 0.0002123736734663221, + "loss": 0.4275330066680908, + "mean_token_accuracy": 0.8670595556497573, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.49691385654515996, + "eval_loss": 0.5491269826889038, + "eval_mean_token_accuracy": 0.850309816210769, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.17, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 980 + }, + { + "entropy": 0.48843890577554705, + "epoch": 2.488169364881694, + "grad_norm": 0.9082473516464233, + "learning_rate": 0.00021141500186075868, + "loss": 0.4309722423553467, + "mean_token_accuracy": 0.8686766296625137, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5543508351195691, + "eval_loss": 0.5478800535202026, + "eval_mean_token_accuracy": 0.8478029522784921, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.3835, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 1000 + }, + { + "entropy": 0.4777219031006098, + "epoch": 2.5379825653798256, + "grad_norm": 0.7448089122772217, + "learning_rate": 0.0002104266917731438, + "loss": 0.423325252532959, + "mean_token_accuracy": 0.8706337086856365, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.49857561550168106, + "eval_loss": 0.5511948466300964, + "eval_mean_token_accuracy": 0.8502220289651737, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.5399, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.988, + "step": 1020 + }, + { + "entropy": 0.4844174191355705, + "epoch": 2.587795765877958, + "grad_norm": 0.794029176235199, + "learning_rate": 0.00020940904126432, + "loss": 0.4176753044128418, + "mean_token_accuracy": 0.873535567522049, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.485467542222766, + "eval_loss": 0.5539286732673645, + "eval_mean_token_accuracy": 0.8495475081510322, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.135, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 1.997, + "step": 1040 + }, + { + "entropy": 0.49070929251611234, + "epoch": 2.6376089663760895, + "grad_norm": 0.7558256983757019, + "learning_rate": 0.0002083623572438007, + "loss": 0.42867293357849123, + "mean_token_accuracy": 0.8696666076779366, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.490822730889154, + "eval_loss": 0.5434785485267639, + "eval_mean_token_accuracy": 0.850568296950917, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.4933, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 1060 + }, + { + "entropy": 0.47806114703416824, + "epoch": 2.6874221668742218, + "grad_norm": 0.6608979105949402, + "learning_rate": 0.00020728695537721047, + "loss": 0.4289727687835693, + "mean_token_accuracy": 0.8693130135536193, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.5285773256490397, + "eval_loss": 0.5444230437278748, + "eval_mean_token_accuracy": 0.8498796481032704, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.7091, + "eval_samples_per_second": 15.858, + "eval_steps_per_second": 1.984, + "step": 1080 + }, + { + "entropy": 0.5046216730028391, + "epoch": 2.7372353673723535, + "grad_norm": 0.8428544998168945, + "learning_rate": 0.00020618315999108454, + "loss": 0.43131070137023925, + "mean_token_accuracy": 0.8701941035687923, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.49888394738352576, + "eval_loss": 0.5459766387939453, + "eval_mean_token_accuracy": 0.8511758872935938, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.2222, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.995, + "step": 1100 + }, + { + "entropy": 0.5212558470666409, + "epoch": 2.7870485678704857, + "grad_norm": 1.129318118095398, + "learning_rate": 0.00020505130397505635, + "loss": 0.44249300956726073, + "mean_token_accuracy": 0.8654101334512234, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5179622324053631, + "eval_loss": 0.5522801280021667, + "eval_mean_token_accuracy": 0.8497019947268242, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.1903, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.996, + "step": 1120 + }, + { + "entropy": 0.4988406613469124, + "epoch": 2.8368617683686175, + "grad_norm": 0.6460545063018799, + "learning_rate": 0.00020389172868146263, + "loss": 0.4386270523071289, + "mean_token_accuracy": 0.8690383620560169, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.5042278484203094, + "eval_loss": 0.5433034300804138, + "eval_mean_token_accuracy": 0.8497674451317898, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.3028, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.993, + "step": 1140 + }, + { + "entropy": 0.4926559619605541, + "epoch": 2.8866749688667497, + "grad_norm": 0.8199329972267151, + "learning_rate": 0.00020270478382239615, + "loss": 0.4313485145568848, + "mean_token_accuracy": 0.8674727231264114, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.503873193160046, + "eval_loss": 0.5388111472129822, + "eval_mean_token_accuracy": 0.8526195034731266, + "eval_num_tokens": 2710196.0, + "eval_runtime": 86.4054, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.991, + "step": 1160 + }, + { + "entropy": 0.5020013231784105, + "epoch": 2.936488169364882, + "grad_norm": 0.7344821095466614, + "learning_rate": 0.00020149082736423723, + "loss": 0.43590536117553713, + "mean_token_accuracy": 0.8671772189438343, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5368241809828337, + "eval_loss": 0.5355703830718994, + "eval_mean_token_accuracy": 0.8517617773871089, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.2945, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1180 + }, + { + "entropy": 0.5112275708466768, + "epoch": 2.9863013698630136, + "grad_norm": 0.6951606869697571, + "learning_rate": 0.00020025022541969622, + "loss": 0.43579301834106443, + "mean_token_accuracy": 0.8641206480562686, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.5066795706055885, + "eval_loss": 0.5415249466896057, + "eval_mean_token_accuracy": 0.8493563373421513, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.5005, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.988, + "step": 1200 + }, + { + "entropy": 0.42298635305502474, + "epoch": 3.0348692403486925, + "grad_norm": 0.8201794028282166, + "learning_rate": 0.00019898335213739863, + "loss": 0.35593905448913576, + "mean_token_accuracy": 0.889238600547497, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.4584170470750609, + "eval_loss": 0.569487452507019, + "eval_mean_token_accuracy": 0.8495814173027526, + "eval_num_tokens": 2848509.0, + "eval_runtime": 86.2281, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 1220 + }, + { + "entropy": 0.37450140453875064, + "epoch": 3.0846824408468243, + "grad_norm": 0.7308394908905029, + "learning_rate": 0.0001976905895890471, + "loss": 0.307823920249939, + "mean_token_accuracy": 0.9001288741827012, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.45185995916294497, + "eval_loss": 0.5672881603240967, + "eval_mean_token_accuracy": 0.8511318519364955, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.0819, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.998, + "step": 1240 + }, + { + "entropy": 0.3887945845723152, + "epoch": 3.1344956413449565, + "grad_norm": 0.7299330830574036, + "learning_rate": 0.0001963723276541939, + "loss": 0.32047903537750244, + "mean_token_accuracy": 0.8960984498262405, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.44865354549053105, + "eval_loss": 0.5666037201881409, + "eval_mean_token_accuracy": 0.8496572649063066, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 1260 + }, + { + "entropy": 0.39677664265036583, + "epoch": 3.1843088418430883, + "grad_norm": 0.9533219933509827, + "learning_rate": 0.00019502896390265838, + "loss": 0.3253983497619629, + "mean_token_accuracy": 0.8964207418262958, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.4641980809527774, + "eval_loss": 0.5814996957778931, + "eval_mean_token_accuracy": 0.8485886212005171, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.7784, + "eval_samples_per_second": 15.845, + "eval_steps_per_second": 1.982, + "step": 1280 + }, + { + "entropy": 0.39210722744464876, + "epoch": 3.2341220423412205, + "grad_norm": 0.7447651028633118, + "learning_rate": 0.00019366090347462545, + "loss": 0.3276803970336914, + "mean_token_accuracy": 0.8930055953562259, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43595615254585135, + "eval_loss": 0.5722188353538513, + "eval_mean_token_accuracy": 0.8501105755567551, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.5271, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 1300 + }, + { + "entropy": 0.3684127271175385, + "epoch": 3.2839352428393527, + "grad_norm": 0.6934201121330261, + "learning_rate": 0.00019226855895846078, + "loss": 0.3156379222869873, + "mean_token_accuracy": 0.8976306475698947, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.4628148723480313, + "eval_loss": 0.5631352066993713, + "eval_mean_token_accuracy": 0.8504934813394103, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.3436, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 1320 + }, + { + "entropy": 0.4073401909321547, + "epoch": 3.3337484433374844, + "grad_norm": 0.9386897683143616, + "learning_rate": 0.00019085235026627994, + "loss": 0.34265310764312745, + "mean_token_accuracy": 0.8902062118053437, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.46455050623694133, + "eval_loss": 0.5586736798286438, + "eval_mean_token_accuracy": 0.8506874702004499, + "eval_num_tokens": 3132874.0, + "eval_runtime": 86.1286, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.997, + "step": 1340 + }, + { + "entropy": 0.4046429242938757, + "epoch": 3.383561643835616, + "grad_norm": 0.9633992314338684, + "learning_rate": 0.00018941270450730836, + "loss": 0.33816893100738527, + "mean_token_accuracy": 0.8927541889250279, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.46846531660750856, + "eval_loss": 0.561501681804657, + "eval_mean_token_accuracy": 0.8496256377114806, + "eval_num_tokens": 3178055.0, + "eval_runtime": 86.685, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1360 + }, + { + "entropy": 0.39872407019138334, + "epoch": 3.4333748443337484, + "grad_norm": 0.7786458730697632, + "learning_rate": 0.00018795005585907113, + "loss": 0.33342490196228025, + "mean_token_accuracy": 0.8944805048406124, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.42709505973860273, + "eval_loss": 0.5751848220825195, + "eval_mean_token_accuracy": 0.8507290447867194, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.6892, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 1380 + }, + { + "entropy": 0.3923338124528527, + "epoch": 3.4831880448318806, + "grad_norm": 0.9305956363677979, + "learning_rate": 0.0001864648454364511, + "loss": 0.33188116550445557, + "mean_token_accuracy": 0.8943330392241478, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.4386174779298694, + "eval_loss": 0.5680831074714661, + "eval_mean_token_accuracy": 0.8513129727784977, + "eval_num_tokens": 3274096.0, + "eval_runtime": 86.2671, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 1400 + }, + { + "entropy": 0.3856233984231949, + "epoch": 3.5330012453300124, + "grad_norm": 1.0362752676010132, + "learning_rate": 0.0001849575211586545, + "loss": 0.33098697662353516, + "mean_token_accuracy": 0.8961390435695649, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4574795474493226, + "eval_loss": 0.5630439519882202, + "eval_mean_token_accuracy": 0.8520988873964133, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.6035, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 1420 + }, + { + "entropy": 0.39812871962785723, + "epoch": 3.5828144458281446, + "grad_norm": 0.7807195782661438, + "learning_rate": 0.0001834285376141247, + "loss": 0.3333771228790283, + "mean_token_accuracy": 0.8930827379226685, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.4556825893909432, + "eval_loss": 0.5689062476158142, + "eval_mean_token_accuracy": 0.8507103507601937, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.1606, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.996, + "step": 1440 + }, + { + "entropy": 0.4147744856774807, + "epoch": 3.6326276463262763, + "grad_norm": 0.6429352164268494, + "learning_rate": 0.00018187835592344443, + "loss": 0.3482560873031616, + "mean_token_accuracy": 0.8910200245678425, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.46600024540757023, + "eval_loss": 0.5609709024429321, + "eval_mean_token_accuracy": 0.8491220876227977, + "eval_num_tokens": 3415600.0, + "eval_runtime": 86.8039, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1460 + }, + { + "entropy": 0.40425071083009245, + "epoch": 3.6824408468244085, + "grad_norm": 0.8613698482513428, + "learning_rate": 0.0001803074436002682, + "loss": 0.342916464805603, + "mean_token_accuracy": 0.8916418336331844, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.43855057899342026, + "eval_loss": 0.5720968246459961, + "eval_mean_token_accuracy": 0.8500823641932288, + "eval_num_tokens": 3460471.0, + "eval_runtime": 86.6746, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1480 + }, + { + "entropy": 0.39465143866837027, + "epoch": 3.7322540473225407, + "grad_norm": 0.6285189986228943, + "learning_rate": 0.0001787162744103265, + "loss": 0.3424591779708862, + "mean_token_accuracy": 0.8906558901071548, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4509461877304454, + "eval_loss": 0.5590082406997681, + "eval_mean_token_accuracy": 0.8511747371318729, + "eval_num_tokens": 3507647.0, + "eval_runtime": 86.8126, + "eval_samples_per_second": 15.839, + "eval_steps_per_second": 1.981, + "step": 1500 + }, + { + "entropy": 0.4021005939692259, + "epoch": 3.7820672478206725, + "grad_norm": 0.8821248412132263, + "learning_rate": 0.00017710532822854468, + "loss": 0.3462103843688965, + "mean_token_accuracy": 0.889109355956316, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.4502199075596277, + "eval_loss": 0.566046416759491, + "eval_mean_token_accuracy": 0.8501714208098345, + "eval_num_tokens": 3548934.0, + "eval_runtime": 86.8336, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.981, + "step": 1520 + }, + { + "entropy": 0.4017397932708263, + "epoch": 3.8318804483188043, + "grad_norm": 0.8400952816009521, + "learning_rate": 0.0001754750908943189, + "loss": 0.34890995025634763, + "mean_token_accuracy": 0.8892098367214203, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.4614003023435903, + "eval_loss": 0.5617933869361877, + "eval_mean_token_accuracy": 0.8515863616106122, + "eval_num_tokens": 3597186.0, + "eval_runtime": 86.4609, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 1540 + }, + { + "entropy": 0.4112051840871572, + "epoch": 3.8816936488169365, + "grad_norm": 0.769478440284729, + "learning_rate": 0.0001738260540649939, + "loss": 0.34711437225341796, + "mean_token_accuracy": 0.8911717928946018, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4540443811998811, + "eval_loss": 0.5576469898223877, + "eval_mean_token_accuracy": 0.8512079674144124, + "eval_num_tokens": 3646646.0, + "eval_runtime": 86.5103, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 1560 + }, + { + "entropy": 0.41105241514742374, + "epoch": 3.9315068493150687, + "grad_norm": 0.8468427062034607, + "learning_rate": 0.00017215871506758568, + "loss": 0.3433023452758789, + "mean_token_accuracy": 0.8898739732801915, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.4707539707075718, + "eval_loss": 0.5641466379165649, + "eval_mean_token_accuracy": 0.8495440957851188, + "eval_num_tokens": 3689560.0, + "eval_runtime": 86.609, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.986, + "step": 1580 + }, + { + "entropy": 0.41016379147768023, + "epoch": 3.9813200498132004, + "grad_norm": 0.7482675313949585, + "learning_rate": 0.0001704735767487946, + "loss": 0.34550890922546384, + "mean_token_accuracy": 0.8893028847873211, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.46391099864660307, + "eval_loss": 0.5593640804290771, + "eval_mean_token_accuracy": 0.8510130581467651, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.3975, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 1600 + }, + { + "entropy": 0.33167599791135544, + "epoch": 4.029887920298879, + "grad_norm": 0.9435692429542542, + "learning_rate": 0.00016877114732335337, + "loss": 0.2716026544570923, + "mean_token_accuracy": 0.9133149828666296, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.38499350005457567, + "eval_loss": 0.6298249363899231, + "eval_mean_token_accuracy": 0.8488117071778275, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.2933, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1620 + }, + { + "entropy": 0.3000166634097695, + "epoch": 4.0797011207970115, + "grad_norm": 0.8080845475196838, + "learning_rate": 0.0001670519402207569, + "loss": 0.22617182731628419, + "mean_token_accuracy": 0.9253474645316601, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.370110988703578, + "eval_loss": 0.6338461637496948, + "eval_mean_token_accuracy": 0.8485634801692741, + "eval_num_tokens": 3828830.0, + "eval_runtime": 85.9508, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.001, + "step": 1640 + }, + { + "entropy": 0.2986910421401262, + "epoch": 4.129514321295143, + "grad_norm": 0.7310900092124939, + "learning_rate": 0.0001653164739304185, + "loss": 0.22367463111877442, + "mean_token_accuracy": 0.9252275295555592, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.3944379702037157, + "eval_loss": 0.6109381914138794, + "eval_mean_token_accuracy": 0.849291454220927, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.6728, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1660 + }, + { + "entropy": 0.3095553796738386, + "epoch": 4.179327521793275, + "grad_norm": 0.7059140801429749, + "learning_rate": 0.0001635652718453007, + "loss": 0.23651680946350098, + "mean_token_accuracy": 0.9208931416273117, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.3910588648949945, + "eval_loss": 0.6104469299316406, + "eval_mean_token_accuracy": 0.8486883893262508, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7612, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.982, + "step": 1680 + }, + { + "entropy": 0.3001101028174162, + "epoch": 4.229140722291407, + "grad_norm": 0.6787802577018738, + "learning_rate": 0.00016179886210406728, + "loss": 0.23130471706390382, + "mean_token_accuracy": 0.9233332790434361, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3794369170832079, + "eval_loss": 0.6182110905647278, + "eval_mean_token_accuracy": 0.8495433777570724, + "eval_num_tokens": 3967474.0, + "eval_runtime": 85.94, + "eval_samples_per_second": 16.0, + "eval_steps_per_second": 2.001, + "step": 1700 + }, + { + "entropy": 0.3031421799212694, + "epoch": 4.2789539227895395, + "grad_norm": 0.9732038378715515, + "learning_rate": 0.0001600177774318036, + "loss": 0.2359529733657837, + "mean_token_accuracy": 0.9217648565769195, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3923123094231583, + "eval_loss": 0.6057384610176086, + "eval_mean_token_accuracy": 0.8508818288182103, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7647, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.29365369994193313, + "epoch": 4.328767123287671, + "grad_norm": 0.7681498527526855, + "learning_rate": 0.0001582225549793541, + "loss": 0.2269371747970581, + "mean_token_accuracy": 0.9245341829955578, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.4011661055129628, + "eval_loss": 0.6144486665725708, + "eval_mean_token_accuracy": 0.8480324357054955, + "eval_num_tokens": 4062594.0, + "eval_runtime": 87.1306, + "eval_samples_per_second": 15.781, + "eval_steps_per_second": 1.974, + "step": 1740 + }, + { + "entropy": 0.29396994728595016, + "epoch": 4.378580323785803, + "grad_norm": 1.0001007318496704, + "learning_rate": 0.0001564137361613248, + "loss": 0.22777395248413085, + "mean_token_accuracy": 0.9262309700250626, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38518730195802314, + "eval_loss": 0.6202630400657654, + "eval_mean_token_accuracy": 0.8493869807137999, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6616, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.3096018506214023, + "epoch": 4.428393524283935, + "grad_norm": 1.0448365211486816, + "learning_rate": 0.00015459186649280024, + "loss": 0.23696351051330566, + "mean_token_accuracy": 0.9217322513461113, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.3946371126140273, + "eval_loss": 0.6079026460647583, + "eval_mean_token_accuracy": 0.8492515852978063, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6582, + "eval_samples_per_second": 15.867, + "eval_steps_per_second": 1.985, + "step": 1780 + }, + { + "entropy": 0.32619857545942066, + "epoch": 4.478206724782067, + "grad_norm": 0.7210651636123657, + "learning_rate": 0.00015275749542482337, + "loss": 0.24651215076446534, + "mean_token_accuracy": 0.9177676141262054, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.3947690814560236, + "eval_loss": 0.6065912246704102, + "eval_mean_token_accuracy": 0.8502957744653835, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.5959, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.986, + "step": 1800 + }, + { + "entropy": 0.3193941755220294, + "epoch": 4.5280199252802, + "grad_norm": 0.8281906843185425, + "learning_rate": 0.0001509111761786888, + "loss": 0.23936262130737304, + "mean_token_accuracy": 0.9201708927750587, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38704028864239537, + "eval_loss": 0.6006569266319275, + "eval_mean_token_accuracy": 0.8502406720505205, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.8059, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1820 + }, + { + "entropy": 0.3164879363030195, + "epoch": 4.577833125778331, + "grad_norm": 0.7892968654632568, + "learning_rate": 0.00014905346557909867, + "loss": 0.24541733264923096, + "mean_token_accuracy": 0.9175932116806507, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.38861122120951497, + "eval_loss": 0.6115967631340027, + "eval_mean_token_accuracy": 0.849471275196519, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.2946, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1840 + }, + { + "entropy": 0.3051785985007882, + "epoch": 4.627646326276463, + "grad_norm": 0.8109654188156128, + "learning_rate": 0.0001471849238862319, + "loss": 0.23433220386505127, + "mean_token_accuracy": 0.9206570319831371, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.37162452295076015, + "eval_loss": 0.6184061765670776, + "eval_mean_token_accuracy": 0.8501173268223918, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.6865, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1860 + }, + { + "entropy": 0.3168198253959417, + "epoch": 4.677459526774595, + "grad_norm": 0.9512342214584351, + "learning_rate": 0.0001453061146267775, + "loss": 0.23832404613494873, + "mean_token_accuracy": 0.9197044663131237, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3845940856912801, + "eval_loss": 0.606762707233429, + "eval_mean_token_accuracy": 0.8504838194957999, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.5175, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 1880 + }, + { + "entropy": 0.30791807882487776, + "epoch": 4.7272727272727275, + "grad_norm": 0.8123113512992859, + "learning_rate": 0.00014341760442398248, + "loss": 0.2395785331726074, + "mean_token_accuracy": 0.918928150832653, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.39762327222283494, + "eval_loss": 0.5994202494621277, + "eval_mean_token_accuracy": 0.8509274201337681, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.2873, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.993, + "step": 1900 + }, + { + "entropy": 0.3021434534341097, + "epoch": 4.777085927770859, + "grad_norm": 0.731787383556366, + "learning_rate": 0.000141519962826766, + "loss": 0.23494718074798585, + "mean_token_accuracy": 0.9201403826475143, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.3827026732439219, + "eval_loss": 0.5995895862579346, + "eval_mean_token_accuracy": 0.851468373523202, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.3006, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 1920 + }, + { + "entropy": 0.31626159623265265, + "epoch": 4.826899128268991, + "grad_norm": 0.8848487138748169, + "learning_rate": 0.00013961376213795132, + "loss": 0.2439030647277832, + "mean_token_accuracy": 0.9196575872600079, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.388698436839636, + "eval_loss": 0.6000174283981323, + "eval_mean_token_accuracy": 0.8518068187458571, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.8979, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.979, + "step": 1940 + }, + { + "entropy": 0.30520407035946845, + "epoch": 4.876712328767123, + "grad_norm": 0.8532460927963257, + "learning_rate": 0.00013769957724166695, + "loss": 0.23458616733551024, + "mean_token_accuracy": 0.9221912942826748, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.38777847102908203, + "eval_loss": 0.6004981398582458, + "eval_mean_token_accuracy": 0.8516481768253238, + "eval_num_tokens": 4578167.0, + "eval_runtime": 87.0777, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.975, + "step": 1960 + }, + { + "entropy": 0.3226448342204094, + "epoch": 4.926525529265255, + "grad_norm": 0.6945561766624451, + "learning_rate": 0.0001357779854299694, + "loss": 0.24048397541046143, + "mean_token_accuracy": 0.9195300146937371, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.38581624263247777, + "eval_loss": 0.6029234528541565, + "eval_mean_token_accuracy": 0.8514213260523108, + "eval_num_tokens": 4622316.0, + "eval_runtime": 85.8729, + "eval_samples_per_second": 16.012, + "eval_steps_per_second": 2.003, + "step": 1980 + }, + { + "entropy": 0.3051655298098922, + "epoch": 4.976338729763388, + "grad_norm": 0.7976452708244324, + "learning_rate": 0.00013384956622874001, + "loss": 0.23584742546081544, + "mean_token_accuracy": 0.9216851457953453, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.37913159246361533, + "eval_loss": 0.6057604551315308, + "eval_mean_token_accuracy": 0.8525801203971686, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.1145, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 2000 + }, + { + "entropy": 0.27438195240803254, + "epoch": 5.024906600249066, + "grad_norm": 0.6729586124420166, + "learning_rate": 0.0001319149012229075, + "loss": 0.19775952100753785, + "mean_token_accuracy": 0.9339428559327737, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.3448961910813354, + "eval_loss": 0.6750120520591736, + "eval_mean_token_accuracy": 0.8487970232963562, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.1169, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 2020 + }, + { + "entropy": 0.21423916313797237, + "epoch": 5.074719800747198, + "grad_norm": 0.6934391856193542, + "learning_rate": 0.00012997457388105022, + "loss": 0.1439570426940918, + "mean_token_accuracy": 0.9528236843645572, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.3570949243771475, + "eval_loss": 0.6465504169464111, + "eval_mean_token_accuracy": 0.8490785547467166, + "eval_num_tokens": 4763269.0, + "eval_runtime": 85.9574, + "eval_samples_per_second": 15.996, + "eval_steps_per_second": 2.001, + "step": 2040 + }, + { + "entropy": 0.20838565267622472, + "epoch": 5.12453300124533, + "grad_norm": 0.7286986112594604, + "learning_rate": 0.00012802916937942972, + "loss": 0.14467307329177856, + "mean_token_accuracy": 0.950994835793972, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.3452463157821533, + "eval_loss": 0.6705958843231201, + "eval_mean_token_accuracy": 0.8490352796953778, + "eval_num_tokens": 4809047.0, + "eval_runtime": 86.228, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 2060 + }, + { + "entropy": 0.20453082229942082, + "epoch": 5.174346201743462, + "grad_norm": 0.7515555620193481, + "learning_rate": 0.00012607927442550974, + "loss": 0.13732000589370727, + "mean_token_accuracy": 0.9537357829511166, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.32431264914745506, + "eval_loss": 0.6743043065071106, + "eval_mean_token_accuracy": 0.8504878629085629, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.5948, + "eval_samples_per_second": 15.879, + "eval_steps_per_second": 1.986, + "step": 2080 + }, + { + "entropy": 0.21812320686876774, + "epoch": 5.224159402241594, + "grad_norm": 0.9093465209007263, + "learning_rate": 0.0001241254770810132, + "loss": 0.14311420917510986, + "mean_token_accuracy": 0.9514068141579628, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.33086285835435225, + "eval_loss": 0.6676449179649353, + "eval_mean_token_accuracy": 0.8505287662495015, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 2100 + }, + { + "entropy": 0.2180163251236081, + "epoch": 5.273972602739726, + "grad_norm": 0.6703007221221924, + "learning_rate": 0.00012216836658457075, + "loss": 0.14803968667984008, + "mean_token_accuracy": 0.9521303348243236, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.33162341708707255, + "eval_loss": 0.6658875942230225, + "eval_mean_token_accuracy": 0.8500757605530495, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.6296, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 2120 + }, + { + "entropy": 0.22511130161583423, + "epoch": 5.323785803237858, + "grad_norm": 0.8078880906105042, + "learning_rate": 0.00012020853317401455, + "loss": 0.15228408575057983, + "mean_token_accuracy": 0.947144789993763, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3354601170434508, + "eval_loss": 0.6677829623222351, + "eval_mean_token_accuracy": 0.8482600024273229, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.4689, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.989, + "step": 2140 + }, + { + "entropy": 0.2244176059961319, + "epoch": 5.37359900373599, + "grad_norm": 0.9636075496673584, + "learning_rate": 0.00011824656790837037, + "loss": 0.15260883569717407, + "mean_token_accuracy": 0.9471467643976211, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.3381616926297199, + "eval_loss": 0.6694412231445312, + "eval_mean_token_accuracy": 0.8482369603805764, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.4147, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 2160 + }, + { + "entropy": 0.22982364390045404, + "epoch": 5.423412204234122, + "grad_norm": 0.775401771068573, + "learning_rate": 0.00011628306248960262, + "loss": 0.15140302181243898, + "mean_token_accuracy": 0.9492553934454918, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.3305150235808173, + "eval_loss": 0.6717822551727295, + "eval_mean_token_accuracy": 0.8489849723355715, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.4728, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.989, + "step": 2180 + }, + { + "entropy": 0.21448935717344284, + "epoch": 5.473225404732254, + "grad_norm": 0.6575281023979187, + "learning_rate": 0.00011431860908416465, + "loss": 0.1452319622039795, + "mean_token_accuracy": 0.9505287684500218, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3488145174328671, + "eval_loss": 0.6612305641174316, + "eval_mean_token_accuracy": 0.8492907808963642, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6927, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 2200 + }, + { + "entropy": 0.23091202937066554, + "epoch": 5.523038605230386, + "grad_norm": 0.8909686207771301, + "learning_rate": 0.00011235380014440985, + "loss": 0.15150139331817628, + "mean_token_accuracy": 0.9497875183820724, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.3268539015810157, + "eval_loss": 0.6667542457580566, + "eval_mean_token_accuracy": 0.8499062903398691, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.4644, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 2220 + }, + { + "entropy": 0.2227974807843566, + "epoch": 5.572851805728518, + "grad_norm": 0.6180275082588196, + "learning_rate": 0.0001103892282299158, + "loss": 0.1491069197654724, + "mean_token_accuracy": 0.9488144010305405, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3346347655494546, + "eval_loss": 0.6665948629379272, + "eval_mean_token_accuracy": 0.8499961893918903, + "eval_num_tokens": 5226864.0, + "eval_runtime": 87.0548, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.976, + "step": 2240 + }, + { + "entropy": 0.21368421968072654, + "epoch": 5.62266500622665, + "grad_norm": 0.6004369258880615, + "learning_rate": 0.00010842548582877651, + "loss": 0.14485255479812623, + "mean_token_accuracy": 0.9502056457102299, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.32753298804163933, + "eval_loss": 0.6680151224136353, + "eval_mean_token_accuracy": 0.8515451086121936, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.8524, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.98, + "step": 2260 + }, + { + "entropy": 0.2103635374456644, + "epoch": 5.672478206724782, + "grad_norm": 0.699174702167511, + "learning_rate": 0.00010646316517891613, + "loss": 0.14297772645950318, + "mean_token_accuracy": 0.9512537539005279, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.32966585959806, + "eval_loss": 0.675578773021698, + "eval_mean_token_accuracy": 0.8509623023659684, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.4518, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.99, + "step": 2280 + }, + { + "entropy": 0.22516900151968003, + "epoch": 5.722291407222914, + "grad_norm": 0.6637354493141174, + "learning_rate": 0.00010450285808947797, + "loss": 0.15202572345733642, + "mean_token_accuracy": 0.9482452072203159, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3369456917740578, + "eval_loss": 0.6697061061859131, + "eval_mean_token_accuracy": 0.848603522361711, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.6371, + "eval_samples_per_second": 15.871, + "eval_steps_per_second": 1.985, + "step": 2300 + }, + { + "entropy": 0.21841065725311637, + "epoch": 5.772104607721046, + "grad_norm": 0.7940268516540527, + "learning_rate": 0.00010254515576234297, + "loss": 0.14710167646408082, + "mean_token_accuracy": 0.9493498183786869, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3237486180177955, + "eval_loss": 0.6779657602310181, + "eval_mean_token_accuracy": 0.8500715313955794, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.1826, + "eval_samples_per_second": 15.954, + "eval_steps_per_second": 1.996, + "step": 2320 + }, + { + "entropy": 0.22146204356104135, + "epoch": 5.821917808219178, + "grad_norm": 0.9234833121299744, + "learning_rate": 0.00010059064861383132, + "loss": 0.14720046520233154, + "mean_token_accuracy": 0.9493872679769992, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.32365207564692167, + "eval_loss": 0.6704005002975464, + "eval_mean_token_accuracy": 0.8507985760306203, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.5494, + "eval_samples_per_second": 15.887, + "eval_steps_per_second": 1.987, + "step": 2340 + }, + { + "entropy": 0.20934011954814197, + "epoch": 5.87173100871731, + "grad_norm": 0.5547503232955933, + "learning_rate": 9.863992609664084e-05, + "loss": 0.1464867353439331, + "mean_token_accuracy": 0.9503875687718392, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.3330401429083458, + "eval_loss": 0.6659091114997864, + "eval_mean_token_accuracy": 0.8504848906467127, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.5855, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 2360 + }, + { + "entropy": 0.21678635366261007, + "epoch": 5.921544209215442, + "grad_norm": 0.570612907409668, + "learning_rate": 9.669357652207635e-05, + "loss": 0.14821385145187377, + "mean_token_accuracy": 0.9503940217196941, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3322022325077722, + "eval_loss": 0.6722489595413208, + "eval_mean_token_accuracy": 0.8489979422369669, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.2986, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 2380 + }, + { + "entropy": 0.20932920072227718, + "epoch": 5.971357409713574, + "grad_norm": 0.7879557609558105, + "learning_rate": 9.475218688262262e-05, + "loss": 0.14675841331481934, + "mean_token_accuracy": 0.9507176131010056, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.3199348642902319, + "eval_loss": 0.6698136329650879, + "eval_mean_token_accuracy": 0.8514142130003419, + "eval_num_tokens": 5605400.0, + "eval_runtime": 85.8995, + "eval_samples_per_second": 16.007, + "eval_steps_per_second": 2.002, + "step": 2400 + }, + { + "entropy": 0.21032143919131693, + "epoch": 6.019925280199253, + "grad_norm": 0.5823076367378235, + "learning_rate": 9.281634267491569e-05, + "loss": 0.13322267532348633, + "mean_token_accuracy": 0.9550939072401096, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.30206270117399303, + "eval_loss": 0.7093168497085571, + "eval_mean_token_accuracy": 0.8500627639681794, + "eval_num_tokens": 5648968.0, + "eval_runtime": 85.8128, + "eval_samples_per_second": 16.023, + "eval_steps_per_second": 2.004, + "step": 2420 + }, + { + "entropy": 0.1534628233872354, + "epoch": 6.069738480697385, + "grad_norm": 0.710133969783783, + "learning_rate": 9.088662772316508e-05, + "loss": 0.09078952670097351, + "mean_token_accuracy": 0.9678447999060154, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.28208133101809857, + "eval_loss": 0.7636417150497437, + "eval_mean_token_accuracy": 0.8494061477655588, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9724, + "eval_samples_per_second": 15.994, + "eval_steps_per_second": 2.001, + "step": 2440 + }, + { + "entropy": 0.16151462448760867, + "epoch": 6.119551681195516, + "grad_norm": 0.5793812274932861, + "learning_rate": 8.896362400308028e-05, + "loss": 0.09545697569847107, + "mean_token_accuracy": 0.9671573750674725, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.2833245605403601, + "eval_loss": 0.7402405738830566, + "eval_mean_token_accuracy": 0.8503523728875226, + "eval_num_tokens": 5745090.0, + "eval_runtime": 85.5461, + "eval_samples_per_second": 16.073, + "eval_steps_per_second": 2.011, + "step": 2460 + }, + { + "entropy": 0.15203177919611335, + "epoch": 6.169364881693649, + "grad_norm": 0.4251123368740082, + "learning_rate": 8.704791146635483e-05, + "loss": 0.09420782327651978, + "mean_token_accuracy": 0.9677386932075024, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.28572545962971313, + "eval_loss": 0.735416829586029, + "eval_mean_token_accuracy": 0.8487084663884584, + "eval_num_tokens": 5790333.0, + "eval_runtime": 85.4801, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.012, + "step": 2480 + }, + { + "entropy": 0.15587336672469973, + "epoch": 6.219178082191781, + "grad_norm": 0.4357028007507324, + "learning_rate": 8.514006786576085e-05, + "loss": 0.09429320096969604, + "mean_token_accuracy": 0.9682952925562859, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.2859006894882335, + "eval_loss": 0.7347224950790405, + "eval_mean_token_accuracy": 0.8501905518215757, + "eval_num_tokens": 5837321.0, + "eval_runtime": 85.7578, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.006, + "step": 2500 + }, + { + "entropy": 0.15765639198943973, + "epoch": 6.268991282689913, + "grad_norm": 0.47331130504608154, + "learning_rate": 8.324066858090663e-05, + "loss": 0.09571113586425781, + "mean_token_accuracy": 0.9683481335639954, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.29231513846059176, + "eval_loss": 0.7392512559890747, + "eval_mean_token_accuracy": 0.8486633983462356, + "eval_num_tokens": 5884398.0, + "eval_runtime": 85.7846, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.005, + "step": 2520 + }, + { + "entropy": 0.16176860257983208, + "epoch": 6.318804483188045, + "grad_norm": 0.6142018437385559, + "learning_rate": 8.135028644470992e-05, + "loss": 0.09486144185066223, + "mean_token_accuracy": 0.9682316601276397, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.2851274753379267, + "eval_loss": 0.7520816922187805, + "eval_mean_token_accuracy": 0.8501113649717597, + "eval_num_tokens": 5929876.0, + "eval_runtime": 85.9425, + "eval_samples_per_second": 15.999, + "eval_steps_per_second": 2.001, + "step": 2540 + }, + { + "entropy": 0.15404034564271568, + "epoch": 6.3686176836861765, + "grad_norm": 0.6051287651062012, + "learning_rate": 7.946949157063964e-05, + "loss": 0.09280472993850708, + "mean_token_accuracy": 0.9684635892510414, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28802703563557114, + "eval_loss": 0.7439162135124207, + "eval_mean_token_accuracy": 0.8499851770872293, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.0703, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.998, + "step": 2560 + }, + { + "entropy": 0.15343588953837753, + "epoch": 6.418430884184309, + "grad_norm": 0.4823743402957916, + "learning_rate": 7.759885118077701e-05, + "loss": 0.09000591039657593, + "mean_token_accuracy": 0.9699928767979145, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2795634938533916, + "eval_loss": 0.7647850513458252, + "eval_mean_token_accuracy": 0.8503464397995971, + "eval_num_tokens": 6025380.0, + "eval_runtime": 85.8886, + "eval_samples_per_second": 16.009, + "eval_steps_per_second": 2.003, + "step": 2580 + }, + { + "entropy": 0.15740026142448188, + "epoch": 6.468244084682441, + "grad_norm": 0.5082696676254272, + "learning_rate": 7.57389294347494e-05, + "loss": 0.09191849827766418, + "mean_token_accuracy": 0.9692809768021107, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2913342311458532, + "eval_loss": 0.7518694996833801, + "eval_mean_token_accuracy": 0.8483168302580367, + "eval_num_tokens": 6073349.0, + "eval_runtime": 85.5761, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.01, + "step": 2600 + }, + { + "entropy": 0.15922069251537324, + "epoch": 6.518057285180573, + "grad_norm": 0.3995199501514435, + "learning_rate": 7.389028725958736e-05, + "loss": 0.09584367871284485, + "mean_token_accuracy": 0.9685114495456218, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.2863075934177221, + "eval_loss": 0.7539381384849548, + "eval_mean_token_accuracy": 0.8507507083027862, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.112, + "eval_samples_per_second": 15.968, + "eval_steps_per_second": 1.997, + "step": 2620 + }, + { + "entropy": 0.16197575423866512, + "epoch": 6.567870485678705, + "grad_norm": 0.534295380115509, + "learning_rate": 7.205348218055678e-05, + "loss": 0.0961170256137848, + "mean_token_accuracy": 0.9674530044198036, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.29021967315050057, + "eval_loss": 0.751198947429657, + "eval_mean_token_accuracy": 0.8509796344956686, + "eval_num_tokens": 6165523.0, + "eval_runtime": 85.7958, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.005, + "step": 2640 + }, + { + "entropy": 0.15261746793985367, + "epoch": 6.617683686176837, + "grad_norm": 0.5391237139701843, + "learning_rate": 7.022906815301673e-05, + "loss": 0.0926026999950409, + "mean_token_accuracy": 0.9695659473538398, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.29128045216202736, + "eval_loss": 0.7450292110443115, + "eval_mean_token_accuracy": 0.8498771443616512, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.3963, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 2660 + }, + { + "entropy": 0.16164180357009172, + "epoch": 6.667496886674969, + "grad_norm": 0.5767946243286133, + "learning_rate": 6.841759539535419e-05, + "loss": 0.09291981458663941, + "mean_token_accuracy": 0.9687136687338352, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2897637223088464, + "eval_loss": 0.7503410577774048, + "eval_mean_token_accuracy": 0.8503315164599308, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.0653, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.998, + "step": 2680 + }, + { + "entropy": 0.17062523355707526, + "epoch": 6.717310087173101, + "grad_norm": 0.4974168539047241, + "learning_rate": 6.661961022304563e-05, + "loss": 0.09713236689567566, + "mean_token_accuracy": 0.9661971725523472, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2765843396963075, + "eval_loss": 0.7604002356529236, + "eval_mean_token_accuracy": 0.8521115277395692, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.1676, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 2700 + }, + { + "entropy": 0.17544092936441302, + "epoch": 6.767123287671232, + "grad_norm": 0.5523537993431091, + "learning_rate": 6.483565488389582e-05, + "loss": 0.09709116220474243, + "mean_token_accuracy": 0.9650957375764847, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.27939334659035814, + "eval_loss": 0.7534670829772949, + "eval_mean_token_accuracy": 0.851230604010959, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.2913, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 2720 + }, + { + "entropy": 0.15991022661328316, + "epoch": 6.816936488169365, + "grad_norm": 0.478551983833313, + "learning_rate": 6.306626739450311e-05, + "loss": 0.09564646482467651, + "mean_token_accuracy": 0.9679084822535515, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.27878295491601146, + "eval_loss": 0.7519959211349487, + "eval_mean_token_accuracy": 0.8510654949864676, + "eval_num_tokens": 6397720.0, + "eval_runtime": 85.9109, + "eval_samples_per_second": 16.005, + "eval_steps_per_second": 2.002, + "step": 2740 + }, + { + "entropy": 0.16824879590421915, + "epoch": 6.866749688667497, + "grad_norm": 0.6681098937988281, + "learning_rate": 6.131198137800108e-05, + "loss": 0.0962279736995697, + "mean_token_accuracy": 0.966830012947321, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.2834690434121808, + "eval_loss": 0.751922070980072, + "eval_mean_token_accuracy": 0.8521237577809844, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.3618, + "eval_samples_per_second": 15.921, + "eval_steps_per_second": 1.992, + "step": 2760 + }, + { + "entropy": 0.1518704930320382, + "epoch": 6.916562889165629, + "grad_norm": 0.5201290249824524, + "learning_rate": 5.957332590312513e-05, + "loss": 0.09010660648345947, + "mean_token_accuracy": 0.9693463340401649, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.28485129617674404, + "eval_loss": 0.7452457547187805, + "eval_mean_token_accuracy": 0.8512036796919135, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.4524, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.99, + "step": 2780 + }, + { + "entropy": 0.15512610590085388, + "epoch": 6.966376089663761, + "grad_norm": 0.42802050709724426, + "learning_rate": 5.785082532465233e-05, + "loss": 0.09320432543754578, + "mean_token_accuracy": 0.9686134628951549, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.27554594526110693, + "eval_loss": 0.7644653916358948, + "eval_mean_token_accuracy": 0.8513738523389018, + "eval_num_tokens": 6540175.0, + "eval_runtime": 85.7609, + "eval_samples_per_second": 16.033, + "eval_steps_per_second": 2.006, + "step": 2800 + }, + { + "entropy": 0.17524497526196334, + "epoch": 7.01494396014944, + "grad_norm": 0.3330269157886505, + "learning_rate": 5.6144999125263545e-05, + "loss": 0.0895616888999939, + "mean_token_accuracy": 0.9682766932707566, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.2735865569218647, + "eval_loss": 0.768479585647583, + "eval_mean_token_accuracy": 0.8503459383581959, + "eval_num_tokens": 6583767.0, + "eval_runtime": 85.7162, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.007, + "step": 2820 + }, + { + "entropy": 0.1403565663844347, + "epoch": 7.064757160647572, + "grad_norm": 0.35613498091697693, + "learning_rate": 5.4456361758874235e-05, + "loss": 0.07551313638687134, + "mean_token_accuracy": 0.9739301167428493, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.25941789089593775, + "eval_loss": 0.8209511637687683, + "eval_mean_token_accuracy": 0.8505055855873019, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.0943, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 2840 + }, + { + "entropy": 0.13500106502324344, + "epoch": 7.114570361145703, + "grad_norm": 0.34418627619743347, + "learning_rate": 5.2785422495482234e-05, + "loss": 0.07293946146965027, + "mean_token_accuracy": 0.9747208289802074, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.26482899772912954, + "eval_loss": 0.798904538154602, + "eval_mean_token_accuracy": 0.8511530233677044, + "eval_num_tokens": 6672946.0, + "eval_runtime": 85.7915, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.005, + "step": 2860 + }, + { + "entropy": 0.13127502552233636, + "epoch": 7.164383561643835, + "grad_norm": 0.4638441503047943, + "learning_rate": 5.113268526757892e-05, + "loss": 0.07121461629867554, + "mean_token_accuracy": 0.9756786689162255, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2645381211714689, + "eval_loss": 0.809101939201355, + "eval_mean_token_accuracy": 0.8514727898115335, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.84, + "eval_samples_per_second": 16.018, + "eval_steps_per_second": 2.004, + "step": 2880 + }, + { + "entropy": 0.1331390908919275, + "epoch": 7.214196762141968, + "grad_norm": 0.40206775069236755, + "learning_rate": 4.949864851817007e-05, + "loss": 0.07188264131546021, + "mean_token_accuracy": 0.9755406074225903, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.26244733283339544, + "eval_loss": 0.8143188953399658, + "eval_mean_token_accuracy": 0.8514358189909957, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.8546, + "eval_samples_per_second": 16.015, + "eval_steps_per_second": 2.003, + "step": 2900 + }, + { + "entropy": 0.13647331558167936, + "epoch": 7.2640099626401, + "grad_norm": 0.26405787467956543, + "learning_rate": 4.788380505045224e-05, + "loss": 0.07412450313568116, + "mean_token_accuracy": 0.9744274213910102, + "num_tokens": 6809678.0, + "step": 2920 + }, + { + "epoch": 7.2640099626401, + "eval_entropy": 0.2626111418182074, + "eval_loss": 0.8111525177955627, + "eval_mean_token_accuracy": 0.8512121695418691, + "eval_num_tokens": 6809678.0, + "eval_runtime": 85.9626, + "eval_samples_per_second": 15.995, + "eval_steps_per_second": 2.001, + "step": 2920 + }, + { + "entropy": 0.12644002586603165, + "epoch": 7.313823163138232, + "grad_norm": 0.27514681220054626, + "learning_rate": 4.6288641879189884e-05, + "loss": 0.06807711124420165, + "mean_token_accuracy": 0.9760703906416893, + "num_tokens": 6860750.0, + "step": 2940 + }, + { + "epoch": 7.313823163138232, + "eval_entropy": 0.26096762734097106, + "eval_loss": 0.8184595108032227, + "eval_mean_token_accuracy": 0.8501476153384807, + "eval_num_tokens": 6860750.0, + "eval_runtime": 85.9521, + "eval_samples_per_second": 15.997, + "eval_steps_per_second": 2.001, + "step": 2940 + }, + { + "entropy": 0.13920630998909472, + "epoch": 7.363636363636363, + "grad_norm": 0.23584705591201782, + "learning_rate": 4.4713640083838604e-05, + "loss": 0.07301607131958007, + "mean_token_accuracy": 0.9745715200901032, + "num_tokens": 6907092.0, + "step": 2960 + }, + { + "epoch": 7.363636363636363, + "eval_entropy": 0.2612536767021168, + "eval_loss": 0.8116245269775391, + "eval_mean_token_accuracy": 0.8510967350976412, + "eval_num_tokens": 6907092.0, + "eval_runtime": 85.6373, + "eval_samples_per_second": 16.056, + "eval_steps_per_second": 2.008, + "step": 2960 + }, + { + "entropy": 0.1349492883309722, + "epoch": 7.4134495641344955, + "grad_norm": 0.24552719295024872, + "learning_rate": 4.315927466345791e-05, + "loss": 0.07397544980049134, + "mean_token_accuracy": 0.9745095103979111, + "num_tokens": 6952700.0, + "step": 2980 + }, + { + "epoch": 7.4134495641344955, + "eval_entropy": 0.25796533306670744, + "eval_loss": 0.8266491293907166, + "eval_mean_token_accuracy": 0.8511653857868772, + "eval_num_tokens": 6952700.0, + "eval_runtime": 85.7462, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.006, + "step": 2980 + }, + { + "entropy": 0.14479175000451505, + "epoch": 7.463262764632628, + "grad_norm": 0.2846072018146515, + "learning_rate": 4.162601439345814e-05, + "loss": 0.07544798254966736, + "mean_token_accuracy": 0.9727819666266442, + "num_tokens": 6996430.0, + "step": 3000 + }, + { + "epoch": 7.463262764632628, + "eval_entropy": 0.2584348309698493, + "eval_loss": 0.8253348469734192, + "eval_mean_token_accuracy": 0.8511569815319638, + "eval_num_tokens": 6996430.0, + "eval_runtime": 86.2984, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 3000 + }, + { + "entropy": 0.14114196319133043, + "epoch": 7.51307596513076, + "grad_norm": 0.407966285943985, + "learning_rate": 4.011432168422419e-05, + "loss": 0.0736398994922638, + "mean_token_accuracy": 0.9741654269397259, + "num_tokens": 7042038.0, + "step": 3020 + }, + { + "epoch": 7.51307596513076, + "eval_entropy": 0.25232676260693127, + "eval_loss": 0.8296052813529968, + "eval_mean_token_accuracy": 0.8523298349491385, + "eval_num_tokens": 7042038.0, + "eval_runtime": 85.8445, + "eval_samples_per_second": 16.017, + "eval_steps_per_second": 2.004, + "step": 3020 + }, + { + "entropy": 0.1353456223383546, + "epoch": 7.562889165628892, + "grad_norm": 0.2712634801864624, + "learning_rate": 3.8624652441658684e-05, + "loss": 0.07362412214279175, + "mean_token_accuracy": 0.9747945807874203, + "num_tokens": 7089390.0, + "step": 3040 + }, + { + "epoch": 7.562889165628892, + "eval_entropy": 0.2579477243991785, + "eval_loss": 0.8274564743041992, + "eval_mean_token_accuracy": 0.8517705212498821, + "eval_num_tokens": 7089390.0, + "eval_runtime": 85.8222, + "eval_samples_per_second": 16.022, + "eval_steps_per_second": 2.004, + "step": 3040 + }, + { + "entropy": 0.1296080862637609, + "epoch": 7.6127023661270234, + "grad_norm": 0.2371893972158432, + "learning_rate": 3.715745592968707e-05, + "loss": 0.06971035599708557, + "mean_token_accuracy": 0.9759043246507645, + "num_tokens": 7138002.0, + "step": 3060 + }, + { + "epoch": 7.6127023661270234, + "eval_entropy": 0.25391967083479083, + "eval_loss": 0.8197130560874939, + "eval_mean_token_accuracy": 0.8522267875283264, + "eval_num_tokens": 7138002.0, + "eval_runtime": 85.8796, + "eval_samples_per_second": 16.011, + "eval_steps_per_second": 2.003, + "step": 3060 + }, + { + "entropy": 0.1311203008517623, + "epoch": 7.662515566625156, + "grad_norm": 0.22499267756938934, + "learning_rate": 3.5713174634765967e-05, + "loss": 0.07176244258880615, + "mean_token_accuracy": 0.9754939571022987, + "num_tokens": 7185520.0, + "step": 3080 + }, + { + "epoch": 7.662515566625156, + "eval_entropy": 0.2526215241225653, + "eval_loss": 0.8265154361724854, + "eval_mean_token_accuracy": 0.8519952584837758, + "eval_num_tokens": 7185520.0, + "eval_runtime": 85.8746, + "eval_samples_per_second": 16.012, + "eval_steps_per_second": 2.003, + "step": 3080 + }, + { + "entropy": 0.13420484317466616, + "epoch": 7.712328767123288, + "grad_norm": 0.2398064285516739, + "learning_rate": 3.4292244132434866e-05, + "loss": 0.07559212446212768, + "mean_token_accuracy": 0.9743142127990723, + "num_tokens": 7232170.0, + "step": 3100 + }, + { + "epoch": 7.712328767123288, + "eval_entropy": 0.2484562756537005, + "eval_loss": 0.8312150239944458, + "eval_mean_token_accuracy": 0.8528405119513356, + "eval_num_tokens": 7232170.0, + "eval_runtime": 85.7896, + "eval_samples_per_second": 16.028, + "eval_steps_per_second": 2.005, + "step": 3100 + }, + { + "entropy": 0.11965563679113984, + "epoch": 7.76214196762142, + "grad_norm": 0.3408384919166565, + "learning_rate": 3.2895092955952746e-05, + "loss": 0.0661750853061676, + "mean_token_accuracy": 0.9776600524783134, + "num_tokens": 7282846.0, + "step": 3120 + }, + { + "epoch": 7.76214196762142, + "eval_entropy": 0.2522421533804993, + "eval_loss": 0.8327009677886963, + "eval_mean_token_accuracy": 0.8524222023958383, + "eval_num_tokens": 7282846.0, + "eval_runtime": 86.1769, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 1.996, + "step": 3120 + }, + { + "entropy": 0.13388084415346385, + "epoch": 7.811955168119551, + "grad_norm": 0.35418516397476196, + "learning_rate": 3.152214246705829e-05, + "loss": 0.07149899601936341, + "mean_token_accuracy": 0.9747635535895824, + "num_tokens": 7331518.0, + "step": 3140 + }, + { + "epoch": 7.811955168119551, + "eval_entropy": 0.25038352296795957, + "eval_loss": 0.836457371711731, + "eval_mean_token_accuracy": 0.8526130665180295, + "eval_num_tokens": 7331518.0, + "eval_runtime": 85.6099, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.009, + "step": 3140 + }, + { + "entropy": 0.13530643959529698, + "epoch": 7.861768368617684, + "grad_norm": 0.38060539960861206, + "learning_rate": 3.017380672889291e-05, + "loss": 0.07116585969924927, + "mean_token_accuracy": 0.973284512758255, + "num_tokens": 7379056.0, + "step": 3160 + }, + { + "epoch": 7.861768368617684, + "eval_entropy": 0.255092611319797, + "eval_loss": 0.8314701914787292, + "eval_mean_token_accuracy": 0.8520913099826768, + "eval_num_tokens": 7379056.0, + "eval_runtime": 85.877, + "eval_samples_per_second": 16.011, + "eval_steps_per_second": 2.003, + "step": 3160 + }, + { + "entropy": 0.13383390177041293, + "epoch": 7.911581569115816, + "grad_norm": 0.3827536106109619, + "learning_rate": 2.8850492381124808e-05, + "loss": 0.07305437326431274, + "mean_token_accuracy": 0.9750778004527092, + "num_tokens": 7424770.0, + "step": 3180 + }, + { + "epoch": 7.911581569115816, + "eval_entropy": 0.25416371157003004, + "eval_loss": 0.8206402063369751, + "eval_mean_token_accuracy": 0.852779901651449, + "eval_num_tokens": 7424770.0, + "eval_runtime": 86.1015, + "eval_samples_per_second": 15.97, + "eval_steps_per_second": 1.998, + "step": 3180 + }, + { + "entropy": 0.1395680439658463, + "epoch": 7.961394769613948, + "grad_norm": 0.3809775412082672, + "learning_rate": 2.7552598517312256e-05, + "loss": 0.07236042022705078, + "mean_token_accuracy": 0.9731538116931915, + "num_tokens": 7470804.0, + "step": 3200 + }, + { + "epoch": 7.961394769613948, + "eval_entropy": 0.25528111975899964, + "eval_loss": 0.8230037093162537, + "eval_mean_token_accuracy": 0.8526452603035195, + "eval_num_tokens": 7470804.0, + "eval_runtime": 85.7895, + "eval_samples_per_second": 16.028, + "eval_steps_per_second": 2.005, + "step": 3200 + }, + { + "entropy": 0.12193699864049752, + "epoch": 8.009962640099626, + "grad_norm": 0.11854425817728043, + "learning_rate": 2.6280516564542205e-05, + "loss": 0.06617764234542847, + "mean_token_accuracy": 0.977179691577569, + "num_tokens": 7518110.0, + "step": 3220 + }, + { + "epoch": 8.009962640099626, + "eval_entropy": 0.25100527677771656, + "eval_loss": 0.8393343687057495, + "eval_mean_token_accuracy": 0.8522553132023922, + "eval_num_tokens": 7518110.0, + "eval_runtime": 85.8837, + "eval_samples_per_second": 16.01, + "eval_steps_per_second": 2.003, + "step": 3220 + }, + { + "entropy": 0.12788885813206435, + "epoch": 8.059775840597759, + "grad_norm": 0.16094881296157837, + "learning_rate": 2.50346301653812e-05, + "loss": 0.06274186968803405, + "mean_token_accuracy": 0.9766994707286358, + "num_tokens": 7565539.0, + "step": 3240 + }, + { + "epoch": 8.059775840597759, + "eval_entropy": 0.24409458682287571, + "eval_loss": 0.874617338180542, + "eval_mean_token_accuracy": 0.8521041180505309, + "eval_num_tokens": 7565539.0, + "eval_runtime": 86.2656, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 3240 + }, + { + "entropy": 0.12464155335910618, + "epoch": 8.10958904109589, + "grad_norm": 0.16893954575061798, + "learning_rate": 2.381531506217437e-05, + "loss": 0.06093020439147949, + "mean_token_accuracy": 0.9776258453726768, + "num_tokens": 7612578.0, + "step": 3260 + }, + { + "epoch": 8.10958904109589, + "eval_entropy": 0.24396493017326953, + "eval_loss": 0.891161322593689, + "eval_mean_token_accuracy": 0.8515338024427724, + "eval_num_tokens": 7612578.0, + "eval_runtime": 85.9061, + "eval_samples_per_second": 16.006, + "eval_steps_per_second": 2.002, + "step": 3260 + }, + { + "entropy": 0.12345920228399336, + "epoch": 8.159402241594023, + "grad_norm": 0.14332273602485657, + "learning_rate": 2.262293898372616e-05, + "loss": 0.061289966106414795, + "mean_token_accuracy": 0.9762230902910233, + "num_tokens": 7660157.0, + "step": 3280 + }, + { + "epoch": 8.159402241594023, + "eval_entropy": 0.2481445314059424, + "eval_loss": 0.8922848105430603, + "eval_mean_token_accuracy": 0.8514944855556932, + "eval_num_tokens": 7660157.0, + "eval_runtime": 85.5201, + "eval_samples_per_second": 16.078, + "eval_steps_per_second": 2.011, + "step": 3280 + }, + { + "entropy": 0.12298110066913068, + "epoch": 8.209215442092155, + "grad_norm": 0.21848882734775543, + "learning_rate": 2.1457861534398633e-05, + "loss": 0.05986443758010864, + "mean_token_accuracy": 0.9786281704902648, + "num_tokens": 7709745.0, + "step": 3300 + }, + { + "epoch": 8.209215442092155, + "eval_entropy": 0.24329388124305149, + "eval_loss": 0.9021085500717163, + "eval_mean_token_accuracy": 0.8521762625422589, + "eval_num_tokens": 7709745.0, + "eval_runtime": 85.955, + "eval_samples_per_second": 15.997, + "eval_steps_per_second": 2.001, + "step": 3300 + }, + { + "entropy": 0.13265180448070168, + "epoch": 8.259028642590286, + "grad_norm": 0.18067947030067444, + "learning_rate": 2.0320434085659692e-05, + "loss": 0.06724961400032044, + "mean_token_accuracy": 0.975098168104887, + "num_tokens": 7753571.0, + "step": 3320 + }, + { + "epoch": 8.259028642590286, + "eval_entropy": 0.2433211464694766, + "eval_loss": 0.9094350337982178, + "eval_mean_token_accuracy": 0.8520150094531304, + "eval_num_tokens": 7753571.0, + "eval_runtime": 85.7989, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.005, + "step": 3320 + }, + { + "entropy": 0.11949320202693343, + "epoch": 8.308841843088418, + "grad_norm": 0.17020289599895477, + "learning_rate": 1.9210999670114196e-05, + "loss": 0.0634455680847168, + "mean_token_accuracy": 0.9771294385194779, + "num_tokens": 7799310.0, + "step": 3340 + }, + { + "epoch": 8.308841843088418, + "eval_entropy": 0.24345201219237128, + "eval_loss": 0.9021793603897095, + "eval_mean_token_accuracy": 0.8520745697409607, + "eval_num_tokens": 7799310.0, + "eval_runtime": 86.0883, + "eval_samples_per_second": 15.972, + "eval_steps_per_second": 1.998, + "step": 3340 + }, + { + "entropy": 0.12065747743472457, + "epoch": 8.35865504358655, + "grad_norm": 0.16789060831069946, + "learning_rate": 1.8129892878049886e-05, + "loss": 0.061494195461273195, + "mean_token_accuracy": 0.9779584899544715, + "num_tokens": 7846447.0, + "step": 3360 + }, + { + "epoch": 8.35865504358655, + "eval_entropy": 0.24093415042342142, + "eval_loss": 0.9006755352020264, + "eval_mean_token_accuracy": 0.852174230786257, + "eval_num_tokens": 7846447.0, + "eval_runtime": 85.9011, + "eval_samples_per_second": 16.007, + "eval_steps_per_second": 2.002, + "step": 3360 + }, + { + "entropy": 0.13125578537583352, + "epoch": 8.408468244084682, + "grad_norm": 0.1662452220916748, + "learning_rate": 1.70774397565298e-05, + "loss": 0.06685600876808166, + "mean_token_accuracy": 0.9744067586958408, + "num_tokens": 7890283.0, + "step": 3380 + }, + { + "epoch": 8.408468244084682, + "eval_entropy": 0.24062153688350388, + "eval_loss": 0.9078915119171143, + "eval_mean_token_accuracy": 0.8523201647886011, + "eval_num_tokens": 7890283.0, + "eval_runtime": 86.0201, + "eval_samples_per_second": 15.985, + "eval_steps_per_second": 2.0, + "step": 3380 + }, + { + "entropy": 0.11986117120832204, + "epoch": 8.458281444582815, + "grad_norm": 0.19571948051452637, + "learning_rate": 1.6053957711060606e-05, + "loss": 0.06411095261573792, + "mean_token_accuracy": 0.9770627245306969, + "num_tokens": 7936518.0, + "step": 3400 + }, + { + "epoch": 8.458281444582815, + "eval_entropy": 0.24352820347561394, + "eval_loss": 0.9058943390846252, + "eval_mean_token_accuracy": 0.8519382792156797, + "eval_num_tokens": 7936518.0, + "eval_runtime": 85.966, + "eval_samples_per_second": 15.995, + "eval_steps_per_second": 2.001, + "step": 3400 + }, + { + "entropy": 0.12857897616922856, + "epoch": 8.508094645080947, + "grad_norm": 0.2609264850616455, + "learning_rate": 1.5059755409867613e-05, + "loss": 0.06473397612571716, + "mean_token_accuracy": 0.9764650195837021, + "num_tokens": 7981966.0, + "step": 3420 + }, + { + "epoch": 8.508094645080947, + "eval_entropy": 0.24032609000108962, + "eval_loss": 0.9077776074409485, + "eval_mean_token_accuracy": 0.8517829197090726, + "eval_num_tokens": 7981966.0, + "eval_runtime": 86.6059, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 3420 + }, + { + "entropy": 0.12348870886489749, + "epoch": 8.557907845579079, + "grad_norm": 0.19537609815597534, + "learning_rate": 1.409513269080473e-05, + "loss": 0.06481348872184753, + "mean_token_accuracy": 0.9769559659063816, + "num_tokens": 8028367.0, + "step": 3440 + }, + { + "epoch": 8.557907845579079, + "eval_entropy": 0.2404322574824788, + "eval_loss": 0.9057720899581909, + "eval_mean_token_accuracy": 0.8521037981953732, + "eval_num_tokens": 8028367.0, + "eval_runtime": 86.166, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.996, + "step": 3440 + }, + { + "entropy": 0.12040232736617326, + "epoch": 8.607721046077211, + "grad_norm": 0.3310582935810089, + "learning_rate": 1.3160380470927183e-05, + "loss": 0.06468871235847473, + "mean_token_accuracy": 0.9768650442361831, + "num_tokens": 8074934.0, + "step": 3460 + }, + { + "epoch": 8.607721046077211, + "eval_entropy": 0.24118655876711356, + "eval_loss": 0.9028318524360657, + "eval_mean_token_accuracy": 0.8521025340224422, + "eval_num_tokens": 8074934.0, + "eval_runtime": 85.3668, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.015, + "step": 3460 + }, + { + "entropy": 0.12328103906475008, + "epoch": 8.657534246575342, + "grad_norm": 0.12836167216300964, + "learning_rate": 1.2255780658755122e-05, + "loss": 0.06229386329650879, + "mean_token_accuracy": 0.9763277888298034, + "num_tokens": 8122775.0, + "step": 3480 + }, + { + "epoch": 8.657534246575342, + "eval_entropy": 0.24194598145956217, + "eval_loss": 0.9009329080581665, + "eval_mean_token_accuracy": 0.8521693289973015, + "eval_num_tokens": 8122775.0, + "eval_runtime": 85.9415, + "eval_samples_per_second": 15.999, + "eval_steps_per_second": 2.001, + "step": 3480 + }, + { + "entropy": 0.11321646976284683, + "epoch": 8.707347447073474, + "grad_norm": 0.15656894445419312, + "learning_rate": 1.1381606069253786e-05, + "loss": 0.05908188819885254, + "mean_token_accuracy": 0.9779504477977753, + "num_tokens": 8174307.0, + "step": 3500 + }, + { + "epoch": 8.707347447073474, + "eval_entropy": 0.24121542517528977, + "eval_loss": 0.9016091823577881, + "eval_mean_token_accuracy": 0.8521790667328724, + "eval_num_tokens": 8174307.0, + "eval_runtime": 85.7465, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.006, + "step": 3500 + }, + { + "entropy": 0.12657046681270004, + "epoch": 8.757160647571606, + "grad_norm": 0.22597502171993256, + "learning_rate": 1.053812034155629e-05, + "loss": 0.06244581937789917, + "mean_token_accuracy": 0.976795207709074, + "num_tokens": 8222808.0, + "step": 3520 + }, + { + "epoch": 8.757160647571606, + "eval_entropy": 0.23877542708502258, + "eval_loss": 0.9069110155105591, + "eval_mean_token_accuracy": 0.8522880177858264, + "eval_num_tokens": 8222808.0, + "eval_runtime": 85.7792, + "eval_samples_per_second": 16.03, + "eval_steps_per_second": 2.005, + "step": 3520 + }, + { + "entropy": 0.11422101808711886, + "epoch": 8.806973848069738, + "grad_norm": 0.21139323711395264, + "learning_rate": 9.725577859453502e-06, + "loss": 0.05988085865974426, + "mean_token_accuracy": 0.9779510758817196, + "num_tokens": 8273335.0, + "step": 3540 + }, + { + "epoch": 8.806973848069738, + "eval_entropy": 0.2393161087881687, + "eval_loss": 0.9033801555633545, + "eval_mean_token_accuracy": 0.8522614209457885, + "eval_num_tokens": 8273335.0, + "eval_runtime": 85.5594, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 3540 + }, + { + "entropy": 0.13810604228638113, + "epoch": 8.85678704856787, + "grad_norm": 0.24571993947029114, + "learning_rate": 8.944223674675537e-06, + "loss": 0.07036117911338806, + "mean_token_accuracy": 0.9734892748296261, + "num_tokens": 8315235.0, + "step": 3560 + }, + { + "epoch": 8.85678704856787, + "eval_entropy": 0.23998506947658782, + "eval_loss": 0.9009848833084106, + "eval_mean_token_accuracy": 0.8521793619837872, + "eval_num_tokens": 8315235.0, + "eval_runtime": 86.0974, + "eval_samples_per_second": 15.97, + "eval_steps_per_second": 1.998, + "step": 3560 + }, + { + "entropy": 0.14193559321574867, + "epoch": 8.906600249066003, + "grad_norm": 0.17304112017154694, + "learning_rate": 8.194293432987386e-06, + "loss": 0.07077967524528503, + "mean_token_accuracy": 0.973305893689394, + "num_tokens": 8358099.0, + "step": 3580 + }, + { + "epoch": 8.906600249066003, + "eval_entropy": 0.23883876689644748, + "eval_loss": 0.9015622138977051, + "eval_mean_token_accuracy": 0.8524864378363587, + "eval_num_tokens": 8358099.0, + "eval_runtime": 86.0089, + "eval_samples_per_second": 15.987, + "eval_steps_per_second": 2.0, + "step": 3580 + }, + { + "entropy": 0.11878943420015275, + "epoch": 8.956413449564135, + "grad_norm": 0.19075658917427063, + "learning_rate": 7.476013303121426e-06, + "loss": 0.060806107521057126, + "mean_token_accuracy": 0.9776863709092141, + "num_tokens": 8407430.0, + "step": 3600 + }, + { + "epoch": 8.956413449564135, + "eval_entropy": 0.23726526309931, + "eval_loss": 0.9060276746749878, + "eval_mean_token_accuracy": 0.8524192058762838, + "eval_num_tokens": 8407430.0, + "eval_runtime": 85.7252, + "eval_samples_per_second": 16.04, + "eval_steps_per_second": 2.006, + "step": 3600 + }, + { + "entropy": 0.1255835090787747, + "epoch": 9.004981320049813, + "grad_norm": 0.11608047038316727, + "learning_rate": 6.78959990856799e-06, + "loss": 0.06319612860679627, + "mean_token_accuracy": 0.9766685519462976, + "num_tokens": 8453175.0, + "step": 3620 + }, + { + "epoch": 9.004981320049813, + "eval_entropy": 0.2373251837006835, + "eval_loss": 0.9045722484588623, + "eval_mean_token_accuracy": 0.8525558363559634, + "eval_num_tokens": 8453175.0, + "eval_runtime": 85.7435, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.006, + "step": 3620 + }, + { + "entropy": 0.12587778437882663, + "epoch": 9.054794520547945, + "grad_norm": 0.1564614623785019, + "learning_rate": 6.135260262244683e-06, + "loss": 0.0630365788936615, + "mean_token_accuracy": 0.9777486085891723, + "num_tokens": 8497151.0, + "step": 3640 + }, + { + "epoch": 9.054794520547945, + "eval_entropy": 0.23559923721260803, + "eval_loss": 0.9120694398880005, + "eval_mean_token_accuracy": 0.8525292966947999, + "eval_num_tokens": 8497151.0, + "eval_runtime": 85.8018, + "eval_samples_per_second": 16.025, + "eval_steps_per_second": 2.005, + "step": 3640 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.586990262147912e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3660/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3660/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3660/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3660/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3660/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3660/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3660/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3660/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3660/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3660/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3660/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3660/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3660/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3660/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..6cb2bd64c823b3818433455081a6279d50b85743 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3660/trainer_state.json @@ -0,0 +1,3877 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 9.104607721046078, + "eval_steps": 20, + "global_step": 3660, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + }, + { + "entropy": 0.561330484598875, + "epoch": 1.891656288916563, + "grad_norm": 0.6722865700721741, + "learning_rate": 0.0002208867897174789, + "loss": 0.499837589263916, + "mean_token_accuracy": 0.8518734864890576, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.5865232653396074, + "eval_loss": 0.5437926650047302, + "eval_mean_token_accuracy": 0.8450997017843779, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4116, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.547389242425561, + "epoch": 1.9414694894146949, + "grad_norm": 0.7935577034950256, + "learning_rate": 0.00022027119820226907, + "loss": 0.4977591514587402, + "mean_token_accuracy": 0.8539491161704064, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.5290903090391048, + "eval_loss": 0.5409526824951172, + "eval_mean_token_accuracy": 0.8497545698354411, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.7262, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 780 + }, + { + "entropy": 0.5687909748405218, + "epoch": 1.9912826899128269, + "grad_norm": 0.6180546283721924, + "learning_rate": 0.00021962329729698345, + "loss": 0.5109643459320068, + "mean_token_accuracy": 0.8521598495543004, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.5503541858390321, + "eval_loss": 0.5361555218696594, + "eval_mean_token_accuracy": 0.8510884285666221, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.3339, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 800 + }, + { + "entropy": 0.4739728841261986, + "epoch": 2.0398505603985058, + "grad_norm": 0.8058829307556152, + "learning_rate": 0.0002189432823996982, + "loss": 0.4204097747802734, + "mean_token_accuracy": 0.8728981889211215, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.5077334992414297, + "eval_loss": 0.5531114339828491, + "eval_mean_token_accuracy": 0.8489257208136625, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.4801, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.989, + "step": 820 + }, + { + "entropy": 0.4594309840351343, + "epoch": 2.0896637608966375, + "grad_norm": 0.6906896829605103, + "learning_rate": 0.0002182313585936314, + "loss": 0.4071959495544434, + "mean_token_accuracy": 0.8732857562601566, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.49850136994622474, + "eval_loss": 0.5486204624176025, + "eval_mean_token_accuracy": 0.8507991450470548, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.3364, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.4881629109382629, + "epoch": 2.1394769613947697, + "grad_norm": 0.6343470215797424, + "learning_rate": 0.0002174877405852928, + "loss": 0.41669540405273436, + "mean_token_accuracy": 0.8711295068264008, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.49155513924914734, + "eval_loss": 0.555109441280365, + "eval_mean_token_accuracy": 0.8496399400539176, + "eval_num_tokens": 2008562.0, + "eval_runtime": 86.3295, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 860 + }, + { + "entropy": 0.4648668970912695, + "epoch": 2.1892901618929015, + "grad_norm": 0.8014165163040161, + "learning_rate": 0.00021671265263973133, + "loss": 0.4110250473022461, + "mean_token_accuracy": 0.8754166305065155, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.4909258722219356, + "eval_loss": 0.5539511442184448, + "eval_mean_token_accuracy": 0.8492401502160138, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.3468, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 880 + }, + { + "entropy": 0.4824485514312983, + "epoch": 2.2391033623910337, + "grad_norm": 0.6665191054344177, + "learning_rate": 0.00021590632851289967, + "loss": 0.4181404113769531, + "mean_token_accuracy": 0.8726993151009083, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.4986876940657926, + "eval_loss": 0.547695517539978, + "eval_mean_token_accuracy": 0.8501384708770486, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.3838, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 900 + }, + { + "entropy": 0.4751896943897009, + "epoch": 2.2889165628891655, + "grad_norm": 0.81158047914505, + "learning_rate": 0.00021506901138115678, + "loss": 0.40689678192138673, + "mean_token_accuracy": 0.8745221219956875, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.507153491121392, + "eval_loss": 0.5501641631126404, + "eval_mean_token_accuracy": 0.8495670116918032, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.0912, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 920 + }, + { + "entropy": 0.4873133715242147, + "epoch": 2.3387297633872977, + "grad_norm": 0.7218056321144104, + "learning_rate": 0.0002142009537679292, + "loss": 0.42701358795166017, + "mean_token_accuracy": 0.8695114746689796, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5202612736543943, + "eval_loss": 0.5491839051246643, + "eval_mean_token_accuracy": 0.8494071208460386, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.1142, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 940 + }, + { + "entropy": 0.4762951169162989, + "epoch": 2.3885429638854294, + "grad_norm": 0.7194424867630005, + "learning_rate": 0.0002133024174675534, + "loss": 0.42299847602844237, + "mean_token_accuracy": 0.8709790132939815, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4899340462546016, + "eval_loss": 0.5522511601448059, + "eval_mean_token_accuracy": 0.8492208258357159, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.463, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 960 + }, + { + "entropy": 0.49650347977876663, + "epoch": 2.4383561643835616, + "grad_norm": 0.8406022787094116, + "learning_rate": 0.0002123736734663221, + "loss": 0.4275330066680908, + "mean_token_accuracy": 0.8670595556497573, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.49691385654515996, + "eval_loss": 0.5491269826889038, + "eval_mean_token_accuracy": 0.850309816210769, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.17, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 980 + }, + { + "entropy": 0.48843890577554705, + "epoch": 2.488169364881694, + "grad_norm": 0.9082473516464233, + "learning_rate": 0.00021141500186075868, + "loss": 0.4309722423553467, + "mean_token_accuracy": 0.8686766296625137, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5543508351195691, + "eval_loss": 0.5478800535202026, + "eval_mean_token_accuracy": 0.8478029522784921, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.3835, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 1000 + }, + { + "entropy": 0.4777219031006098, + "epoch": 2.5379825653798256, + "grad_norm": 0.7448089122772217, + "learning_rate": 0.0002104266917731438, + "loss": 0.423325252532959, + "mean_token_accuracy": 0.8706337086856365, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.49857561550168106, + "eval_loss": 0.5511948466300964, + "eval_mean_token_accuracy": 0.8502220289651737, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.5399, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.988, + "step": 1020 + }, + { + "entropy": 0.4844174191355705, + "epoch": 2.587795765877958, + "grad_norm": 0.794029176235199, + "learning_rate": 0.00020940904126432, + "loss": 0.4176753044128418, + "mean_token_accuracy": 0.873535567522049, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.485467542222766, + "eval_loss": 0.5539286732673645, + "eval_mean_token_accuracy": 0.8495475081510322, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.135, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 1.997, + "step": 1040 + }, + { + "entropy": 0.49070929251611234, + "epoch": 2.6376089663760895, + "grad_norm": 0.7558256983757019, + "learning_rate": 0.0002083623572438007, + "loss": 0.42867293357849123, + "mean_token_accuracy": 0.8696666076779366, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.490822730889154, + "eval_loss": 0.5434785485267639, + "eval_mean_token_accuracy": 0.850568296950917, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.4933, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 1060 + }, + { + "entropy": 0.47806114703416824, + "epoch": 2.6874221668742218, + "grad_norm": 0.6608979105949402, + "learning_rate": 0.00020728695537721047, + "loss": 0.4289727687835693, + "mean_token_accuracy": 0.8693130135536193, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.5285773256490397, + "eval_loss": 0.5444230437278748, + "eval_mean_token_accuracy": 0.8498796481032704, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.7091, + "eval_samples_per_second": 15.858, + "eval_steps_per_second": 1.984, + "step": 1080 + }, + { + "entropy": 0.5046216730028391, + "epoch": 2.7372353673723535, + "grad_norm": 0.8428544998168945, + "learning_rate": 0.00020618315999108454, + "loss": 0.43131070137023925, + "mean_token_accuracy": 0.8701941035687923, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.49888394738352576, + "eval_loss": 0.5459766387939453, + "eval_mean_token_accuracy": 0.8511758872935938, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.2222, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.995, + "step": 1100 + }, + { + "entropy": 0.5212558470666409, + "epoch": 2.7870485678704857, + "grad_norm": 1.129318118095398, + "learning_rate": 0.00020505130397505635, + "loss": 0.44249300956726073, + "mean_token_accuracy": 0.8654101334512234, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5179622324053631, + "eval_loss": 0.5522801280021667, + "eval_mean_token_accuracy": 0.8497019947268242, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.1903, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.996, + "step": 1120 + }, + { + "entropy": 0.4988406613469124, + "epoch": 2.8368617683686175, + "grad_norm": 0.6460545063018799, + "learning_rate": 0.00020389172868146263, + "loss": 0.4386270523071289, + "mean_token_accuracy": 0.8690383620560169, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.5042278484203094, + "eval_loss": 0.5433034300804138, + "eval_mean_token_accuracy": 0.8497674451317898, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.3028, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.993, + "step": 1140 + }, + { + "entropy": 0.4926559619605541, + "epoch": 2.8866749688667497, + "grad_norm": 0.8199329972267151, + "learning_rate": 0.00020270478382239615, + "loss": 0.4313485145568848, + "mean_token_accuracy": 0.8674727231264114, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.503873193160046, + "eval_loss": 0.5388111472129822, + "eval_mean_token_accuracy": 0.8526195034731266, + "eval_num_tokens": 2710196.0, + "eval_runtime": 86.4054, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.991, + "step": 1160 + }, + { + "entropy": 0.5020013231784105, + "epoch": 2.936488169364882, + "grad_norm": 0.7344821095466614, + "learning_rate": 0.00020149082736423723, + "loss": 0.43590536117553713, + "mean_token_accuracy": 0.8671772189438343, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5368241809828337, + "eval_loss": 0.5355703830718994, + "eval_mean_token_accuracy": 0.8517617773871089, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.2945, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1180 + }, + { + "entropy": 0.5112275708466768, + "epoch": 2.9863013698630136, + "grad_norm": 0.6951606869697571, + "learning_rate": 0.00020025022541969622, + "loss": 0.43579301834106443, + "mean_token_accuracy": 0.8641206480562686, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.5066795706055885, + "eval_loss": 0.5415249466896057, + "eval_mean_token_accuracy": 0.8493563373421513, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.5005, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.988, + "step": 1200 + }, + { + "entropy": 0.42298635305502474, + "epoch": 3.0348692403486925, + "grad_norm": 0.8201794028282166, + "learning_rate": 0.00019898335213739863, + "loss": 0.35593905448913576, + "mean_token_accuracy": 0.889238600547497, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.4584170470750609, + "eval_loss": 0.569487452507019, + "eval_mean_token_accuracy": 0.8495814173027526, + "eval_num_tokens": 2848509.0, + "eval_runtime": 86.2281, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 1220 + }, + { + "entropy": 0.37450140453875064, + "epoch": 3.0846824408468243, + "grad_norm": 0.7308394908905029, + "learning_rate": 0.0001976905895890471, + "loss": 0.307823920249939, + "mean_token_accuracy": 0.9001288741827012, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.45185995916294497, + "eval_loss": 0.5672881603240967, + "eval_mean_token_accuracy": 0.8511318519364955, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.0819, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.998, + "step": 1240 + }, + { + "entropy": 0.3887945845723152, + "epoch": 3.1344956413449565, + "grad_norm": 0.7299330830574036, + "learning_rate": 0.0001963723276541939, + "loss": 0.32047903537750244, + "mean_token_accuracy": 0.8960984498262405, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.44865354549053105, + "eval_loss": 0.5666037201881409, + "eval_mean_token_accuracy": 0.8496572649063066, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 1260 + }, + { + "entropy": 0.39677664265036583, + "epoch": 3.1843088418430883, + "grad_norm": 0.9533219933509827, + "learning_rate": 0.00019502896390265838, + "loss": 0.3253983497619629, + "mean_token_accuracy": 0.8964207418262958, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.4641980809527774, + "eval_loss": 0.5814996957778931, + "eval_mean_token_accuracy": 0.8485886212005171, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.7784, + "eval_samples_per_second": 15.845, + "eval_steps_per_second": 1.982, + "step": 1280 + }, + { + "entropy": 0.39210722744464876, + "epoch": 3.2341220423412205, + "grad_norm": 0.7447651028633118, + "learning_rate": 0.00019366090347462545, + "loss": 0.3276803970336914, + "mean_token_accuracy": 0.8930055953562259, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43595615254585135, + "eval_loss": 0.5722188353538513, + "eval_mean_token_accuracy": 0.8501105755567551, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.5271, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 1300 + }, + { + "entropy": 0.3684127271175385, + "epoch": 3.2839352428393527, + "grad_norm": 0.6934201121330261, + "learning_rate": 0.00019226855895846078, + "loss": 0.3156379222869873, + "mean_token_accuracy": 0.8976306475698947, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.4628148723480313, + "eval_loss": 0.5631352066993713, + "eval_mean_token_accuracy": 0.8504934813394103, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.3436, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 1320 + }, + { + "entropy": 0.4073401909321547, + "epoch": 3.3337484433374844, + "grad_norm": 0.9386897683143616, + "learning_rate": 0.00019085235026627994, + "loss": 0.34265310764312745, + "mean_token_accuracy": 0.8902062118053437, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.46455050623694133, + "eval_loss": 0.5586736798286438, + "eval_mean_token_accuracy": 0.8506874702004499, + "eval_num_tokens": 3132874.0, + "eval_runtime": 86.1286, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.997, + "step": 1340 + }, + { + "entropy": 0.4046429242938757, + "epoch": 3.383561643835616, + "grad_norm": 0.9633992314338684, + "learning_rate": 0.00018941270450730836, + "loss": 0.33816893100738527, + "mean_token_accuracy": 0.8927541889250279, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.46846531660750856, + "eval_loss": 0.561501681804657, + "eval_mean_token_accuracy": 0.8496256377114806, + "eval_num_tokens": 3178055.0, + "eval_runtime": 86.685, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1360 + }, + { + "entropy": 0.39872407019138334, + "epoch": 3.4333748443337484, + "grad_norm": 0.7786458730697632, + "learning_rate": 0.00018795005585907113, + "loss": 0.33342490196228025, + "mean_token_accuracy": 0.8944805048406124, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.42709505973860273, + "eval_loss": 0.5751848220825195, + "eval_mean_token_accuracy": 0.8507290447867194, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.6892, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 1380 + }, + { + "entropy": 0.3923338124528527, + "epoch": 3.4831880448318806, + "grad_norm": 0.9305956363677979, + "learning_rate": 0.0001864648454364511, + "loss": 0.33188116550445557, + "mean_token_accuracy": 0.8943330392241478, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.4386174779298694, + "eval_loss": 0.5680831074714661, + "eval_mean_token_accuracy": 0.8513129727784977, + "eval_num_tokens": 3274096.0, + "eval_runtime": 86.2671, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 1400 + }, + { + "entropy": 0.3856233984231949, + "epoch": 3.5330012453300124, + "grad_norm": 1.0362752676010132, + "learning_rate": 0.0001849575211586545, + "loss": 0.33098697662353516, + "mean_token_accuracy": 0.8961390435695649, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4574795474493226, + "eval_loss": 0.5630439519882202, + "eval_mean_token_accuracy": 0.8520988873964133, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.6035, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 1420 + }, + { + "entropy": 0.39812871962785723, + "epoch": 3.5828144458281446, + "grad_norm": 0.7807195782661438, + "learning_rate": 0.0001834285376141247, + "loss": 0.3333771228790283, + "mean_token_accuracy": 0.8930827379226685, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.4556825893909432, + "eval_loss": 0.5689062476158142, + "eval_mean_token_accuracy": 0.8507103507601937, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.1606, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.996, + "step": 1440 + }, + { + "entropy": 0.4147744856774807, + "epoch": 3.6326276463262763, + "grad_norm": 0.6429352164268494, + "learning_rate": 0.00018187835592344443, + "loss": 0.3482560873031616, + "mean_token_accuracy": 0.8910200245678425, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.46600024540757023, + "eval_loss": 0.5609709024429321, + "eval_mean_token_accuracy": 0.8491220876227977, + "eval_num_tokens": 3415600.0, + "eval_runtime": 86.8039, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1460 + }, + { + "entropy": 0.40425071083009245, + "epoch": 3.6824408468244085, + "grad_norm": 0.8613698482513428, + "learning_rate": 0.0001803074436002682, + "loss": 0.342916464805603, + "mean_token_accuracy": 0.8916418336331844, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.43855057899342026, + "eval_loss": 0.5720968246459961, + "eval_mean_token_accuracy": 0.8500823641932288, + "eval_num_tokens": 3460471.0, + "eval_runtime": 86.6746, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1480 + }, + { + "entropy": 0.39465143866837027, + "epoch": 3.7322540473225407, + "grad_norm": 0.6285189986228943, + "learning_rate": 0.0001787162744103265, + "loss": 0.3424591779708862, + "mean_token_accuracy": 0.8906558901071548, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4509461877304454, + "eval_loss": 0.5590082406997681, + "eval_mean_token_accuracy": 0.8511747371318729, + "eval_num_tokens": 3507647.0, + "eval_runtime": 86.8126, + "eval_samples_per_second": 15.839, + "eval_steps_per_second": 1.981, + "step": 1500 + }, + { + "entropy": 0.4021005939692259, + "epoch": 3.7820672478206725, + "grad_norm": 0.8821248412132263, + "learning_rate": 0.00017710532822854468, + "loss": 0.3462103843688965, + "mean_token_accuracy": 0.889109355956316, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.4502199075596277, + "eval_loss": 0.566046416759491, + "eval_mean_token_accuracy": 0.8501714208098345, + "eval_num_tokens": 3548934.0, + "eval_runtime": 86.8336, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.981, + "step": 1520 + }, + { + "entropy": 0.4017397932708263, + "epoch": 3.8318804483188043, + "grad_norm": 0.8400952816009521, + "learning_rate": 0.0001754750908943189, + "loss": 0.34890995025634763, + "mean_token_accuracy": 0.8892098367214203, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.4614003023435903, + "eval_loss": 0.5617933869361877, + "eval_mean_token_accuracy": 0.8515863616106122, + "eval_num_tokens": 3597186.0, + "eval_runtime": 86.4609, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 1540 + }, + { + "entropy": 0.4112051840871572, + "epoch": 3.8816936488169365, + "grad_norm": 0.769478440284729, + "learning_rate": 0.0001738260540649939, + "loss": 0.34711437225341796, + "mean_token_accuracy": 0.8911717928946018, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4540443811998811, + "eval_loss": 0.5576469898223877, + "eval_mean_token_accuracy": 0.8512079674144124, + "eval_num_tokens": 3646646.0, + "eval_runtime": 86.5103, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 1560 + }, + { + "entropy": 0.41105241514742374, + "epoch": 3.9315068493150687, + "grad_norm": 0.8468427062034607, + "learning_rate": 0.00017215871506758568, + "loss": 0.3433023452758789, + "mean_token_accuracy": 0.8898739732801915, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.4707539707075718, + "eval_loss": 0.5641466379165649, + "eval_mean_token_accuracy": 0.8495440957851188, + "eval_num_tokens": 3689560.0, + "eval_runtime": 86.609, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.986, + "step": 1580 + }, + { + "entropy": 0.41016379147768023, + "epoch": 3.9813200498132004, + "grad_norm": 0.7482675313949585, + "learning_rate": 0.0001704735767487946, + "loss": 0.34550890922546384, + "mean_token_accuracy": 0.8893028847873211, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.46391099864660307, + "eval_loss": 0.5593640804290771, + "eval_mean_token_accuracy": 0.8510130581467651, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.3975, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 1600 + }, + { + "entropy": 0.33167599791135544, + "epoch": 4.029887920298879, + "grad_norm": 0.9435692429542542, + "learning_rate": 0.00016877114732335337, + "loss": 0.2716026544570923, + "mean_token_accuracy": 0.9133149828666296, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.38499350005457567, + "eval_loss": 0.6298249363899231, + "eval_mean_token_accuracy": 0.8488117071778275, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.2933, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1620 + }, + { + "entropy": 0.3000166634097695, + "epoch": 4.0797011207970115, + "grad_norm": 0.8080845475196838, + "learning_rate": 0.0001670519402207569, + "loss": 0.22617182731628419, + "mean_token_accuracy": 0.9253474645316601, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.370110988703578, + "eval_loss": 0.6338461637496948, + "eval_mean_token_accuracy": 0.8485634801692741, + "eval_num_tokens": 3828830.0, + "eval_runtime": 85.9508, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.001, + "step": 1640 + }, + { + "entropy": 0.2986910421401262, + "epoch": 4.129514321295143, + "grad_norm": 0.7310900092124939, + "learning_rate": 0.0001653164739304185, + "loss": 0.22367463111877442, + "mean_token_accuracy": 0.9252275295555592, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.3944379702037157, + "eval_loss": 0.6109381914138794, + "eval_mean_token_accuracy": 0.849291454220927, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.6728, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1660 + }, + { + "entropy": 0.3095553796738386, + "epoch": 4.179327521793275, + "grad_norm": 0.7059140801429749, + "learning_rate": 0.0001635652718453007, + "loss": 0.23651680946350098, + "mean_token_accuracy": 0.9208931416273117, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.3910588648949945, + "eval_loss": 0.6104469299316406, + "eval_mean_token_accuracy": 0.8486883893262508, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7612, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.982, + "step": 1680 + }, + { + "entropy": 0.3001101028174162, + "epoch": 4.229140722291407, + "grad_norm": 0.6787802577018738, + "learning_rate": 0.00016179886210406728, + "loss": 0.23130471706390382, + "mean_token_accuracy": 0.9233332790434361, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3794369170832079, + "eval_loss": 0.6182110905647278, + "eval_mean_token_accuracy": 0.8495433777570724, + "eval_num_tokens": 3967474.0, + "eval_runtime": 85.94, + "eval_samples_per_second": 16.0, + "eval_steps_per_second": 2.001, + "step": 1700 + }, + { + "entropy": 0.3031421799212694, + "epoch": 4.2789539227895395, + "grad_norm": 0.9732038378715515, + "learning_rate": 0.0001600177774318036, + "loss": 0.2359529733657837, + "mean_token_accuracy": 0.9217648565769195, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3923123094231583, + "eval_loss": 0.6057384610176086, + "eval_mean_token_accuracy": 0.8508818288182103, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7647, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.29365369994193313, + "epoch": 4.328767123287671, + "grad_norm": 0.7681498527526855, + "learning_rate": 0.0001582225549793541, + "loss": 0.2269371747970581, + "mean_token_accuracy": 0.9245341829955578, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.4011661055129628, + "eval_loss": 0.6144486665725708, + "eval_mean_token_accuracy": 0.8480324357054955, + "eval_num_tokens": 4062594.0, + "eval_runtime": 87.1306, + "eval_samples_per_second": 15.781, + "eval_steps_per_second": 1.974, + "step": 1740 + }, + { + "entropy": 0.29396994728595016, + "epoch": 4.378580323785803, + "grad_norm": 1.0001007318496704, + "learning_rate": 0.0001564137361613248, + "loss": 0.22777395248413085, + "mean_token_accuracy": 0.9262309700250626, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38518730195802314, + "eval_loss": 0.6202630400657654, + "eval_mean_token_accuracy": 0.8493869807137999, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6616, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.3096018506214023, + "epoch": 4.428393524283935, + "grad_norm": 1.0448365211486816, + "learning_rate": 0.00015459186649280024, + "loss": 0.23696351051330566, + "mean_token_accuracy": 0.9217322513461113, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.3946371126140273, + "eval_loss": 0.6079026460647583, + "eval_mean_token_accuracy": 0.8492515852978063, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6582, + "eval_samples_per_second": 15.867, + "eval_steps_per_second": 1.985, + "step": 1780 + }, + { + "entropy": 0.32619857545942066, + "epoch": 4.478206724782067, + "grad_norm": 0.7210651636123657, + "learning_rate": 0.00015275749542482337, + "loss": 0.24651215076446534, + "mean_token_accuracy": 0.9177676141262054, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.3947690814560236, + "eval_loss": 0.6065912246704102, + "eval_mean_token_accuracy": 0.8502957744653835, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.5959, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.986, + "step": 1800 + }, + { + "entropy": 0.3193941755220294, + "epoch": 4.5280199252802, + "grad_norm": 0.8281906843185425, + "learning_rate": 0.0001509111761786888, + "loss": 0.23936262130737304, + "mean_token_accuracy": 0.9201708927750587, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38704028864239537, + "eval_loss": 0.6006569266319275, + "eval_mean_token_accuracy": 0.8502406720505205, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.8059, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1820 + }, + { + "entropy": 0.3164879363030195, + "epoch": 4.577833125778331, + "grad_norm": 0.7892968654632568, + "learning_rate": 0.00014905346557909867, + "loss": 0.24541733264923096, + "mean_token_accuracy": 0.9175932116806507, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.38861122120951497, + "eval_loss": 0.6115967631340027, + "eval_mean_token_accuracy": 0.849471275196519, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.2946, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1840 + }, + { + "entropy": 0.3051785985007882, + "epoch": 4.627646326276463, + "grad_norm": 0.8109654188156128, + "learning_rate": 0.0001471849238862319, + "loss": 0.23433220386505127, + "mean_token_accuracy": 0.9206570319831371, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.37162452295076015, + "eval_loss": 0.6184061765670776, + "eval_mean_token_accuracy": 0.8501173268223918, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.6865, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1860 + }, + { + "entropy": 0.3168198253959417, + "epoch": 4.677459526774595, + "grad_norm": 0.9512342214584351, + "learning_rate": 0.0001453061146267775, + "loss": 0.23832404613494873, + "mean_token_accuracy": 0.9197044663131237, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3845940856912801, + "eval_loss": 0.606762707233429, + "eval_mean_token_accuracy": 0.8504838194957999, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.5175, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 1880 + }, + { + "entropy": 0.30791807882487776, + "epoch": 4.7272727272727275, + "grad_norm": 0.8123113512992859, + "learning_rate": 0.00014341760442398248, + "loss": 0.2395785331726074, + "mean_token_accuracy": 0.918928150832653, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.39762327222283494, + "eval_loss": 0.5994202494621277, + "eval_mean_token_accuracy": 0.8509274201337681, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.2873, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.993, + "step": 1900 + }, + { + "entropy": 0.3021434534341097, + "epoch": 4.777085927770859, + "grad_norm": 0.731787383556366, + "learning_rate": 0.000141519962826766, + "loss": 0.23494718074798585, + "mean_token_accuracy": 0.9201403826475143, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.3827026732439219, + "eval_loss": 0.5995895862579346, + "eval_mean_token_accuracy": 0.851468373523202, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.3006, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 1920 + }, + { + "entropy": 0.31626159623265265, + "epoch": 4.826899128268991, + "grad_norm": 0.8848487138748169, + "learning_rate": 0.00013961376213795132, + "loss": 0.2439030647277832, + "mean_token_accuracy": 0.9196575872600079, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.388698436839636, + "eval_loss": 0.6000174283981323, + "eval_mean_token_accuracy": 0.8518068187458571, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.8979, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.979, + "step": 1940 + }, + { + "entropy": 0.30520407035946845, + "epoch": 4.876712328767123, + "grad_norm": 0.8532460927963257, + "learning_rate": 0.00013769957724166695, + "loss": 0.23458616733551024, + "mean_token_accuracy": 0.9221912942826748, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.38777847102908203, + "eval_loss": 0.6004981398582458, + "eval_mean_token_accuracy": 0.8516481768253238, + "eval_num_tokens": 4578167.0, + "eval_runtime": 87.0777, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.975, + "step": 1960 + }, + { + "entropy": 0.3226448342204094, + "epoch": 4.926525529265255, + "grad_norm": 0.6945561766624451, + "learning_rate": 0.0001357779854299694, + "loss": 0.24048397541046143, + "mean_token_accuracy": 0.9195300146937371, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.38581624263247777, + "eval_loss": 0.6029234528541565, + "eval_mean_token_accuracy": 0.8514213260523108, + "eval_num_tokens": 4622316.0, + "eval_runtime": 85.8729, + "eval_samples_per_second": 16.012, + "eval_steps_per_second": 2.003, + "step": 1980 + }, + { + "entropy": 0.3051655298098922, + "epoch": 4.976338729763388, + "grad_norm": 0.7976452708244324, + "learning_rate": 0.00013384956622874001, + "loss": 0.23584742546081544, + "mean_token_accuracy": 0.9216851457953453, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.37913159246361533, + "eval_loss": 0.6057604551315308, + "eval_mean_token_accuracy": 0.8525801203971686, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.1145, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 2000 + }, + { + "entropy": 0.27438195240803254, + "epoch": 5.024906600249066, + "grad_norm": 0.6729586124420166, + "learning_rate": 0.0001319149012229075, + "loss": 0.19775952100753785, + "mean_token_accuracy": 0.9339428559327737, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.3448961910813354, + "eval_loss": 0.6750120520591736, + "eval_mean_token_accuracy": 0.8487970232963562, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.1169, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 2020 + }, + { + "entropy": 0.21423916313797237, + "epoch": 5.074719800747198, + "grad_norm": 0.6934391856193542, + "learning_rate": 0.00012997457388105022, + "loss": 0.1439570426940918, + "mean_token_accuracy": 0.9528236843645572, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.3570949243771475, + "eval_loss": 0.6465504169464111, + "eval_mean_token_accuracy": 0.8490785547467166, + "eval_num_tokens": 4763269.0, + "eval_runtime": 85.9574, + "eval_samples_per_second": 15.996, + "eval_steps_per_second": 2.001, + "step": 2040 + }, + { + "entropy": 0.20838565267622472, + "epoch": 5.12453300124533, + "grad_norm": 0.7286986112594604, + "learning_rate": 0.00012802916937942972, + "loss": 0.14467307329177856, + "mean_token_accuracy": 0.950994835793972, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.3452463157821533, + "eval_loss": 0.6705958843231201, + "eval_mean_token_accuracy": 0.8490352796953778, + "eval_num_tokens": 4809047.0, + "eval_runtime": 86.228, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 2060 + }, + { + "entropy": 0.20453082229942082, + "epoch": 5.174346201743462, + "grad_norm": 0.7515555620193481, + "learning_rate": 0.00012607927442550974, + "loss": 0.13732000589370727, + "mean_token_accuracy": 0.9537357829511166, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.32431264914745506, + "eval_loss": 0.6743043065071106, + "eval_mean_token_accuracy": 0.8504878629085629, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.5948, + "eval_samples_per_second": 15.879, + "eval_steps_per_second": 1.986, + "step": 2080 + }, + { + "entropy": 0.21812320686876774, + "epoch": 5.224159402241594, + "grad_norm": 0.9093465209007263, + "learning_rate": 0.0001241254770810132, + "loss": 0.14311420917510986, + "mean_token_accuracy": 0.9514068141579628, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.33086285835435225, + "eval_loss": 0.6676449179649353, + "eval_mean_token_accuracy": 0.8505287662495015, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 2100 + }, + { + "entropy": 0.2180163251236081, + "epoch": 5.273972602739726, + "grad_norm": 0.6703007221221924, + "learning_rate": 0.00012216836658457075, + "loss": 0.14803968667984008, + "mean_token_accuracy": 0.9521303348243236, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.33162341708707255, + "eval_loss": 0.6658875942230225, + "eval_mean_token_accuracy": 0.8500757605530495, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.6296, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 2120 + }, + { + "entropy": 0.22511130161583423, + "epoch": 5.323785803237858, + "grad_norm": 0.8078880906105042, + "learning_rate": 0.00012020853317401455, + "loss": 0.15228408575057983, + "mean_token_accuracy": 0.947144789993763, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3354601170434508, + "eval_loss": 0.6677829623222351, + "eval_mean_token_accuracy": 0.8482600024273229, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.4689, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.989, + "step": 2140 + }, + { + "entropy": 0.2244176059961319, + "epoch": 5.37359900373599, + "grad_norm": 0.9636075496673584, + "learning_rate": 0.00011824656790837037, + "loss": 0.15260883569717407, + "mean_token_accuracy": 0.9471467643976211, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.3381616926297199, + "eval_loss": 0.6694412231445312, + "eval_mean_token_accuracy": 0.8482369603805764, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.4147, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 2160 + }, + { + "entropy": 0.22982364390045404, + "epoch": 5.423412204234122, + "grad_norm": 0.775401771068573, + "learning_rate": 0.00011628306248960262, + "loss": 0.15140302181243898, + "mean_token_accuracy": 0.9492553934454918, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.3305150235808173, + "eval_loss": 0.6717822551727295, + "eval_mean_token_accuracy": 0.8489849723355715, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.4728, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.989, + "step": 2180 + }, + { + "entropy": 0.21448935717344284, + "epoch": 5.473225404732254, + "grad_norm": 0.6575281023979187, + "learning_rate": 0.00011431860908416465, + "loss": 0.1452319622039795, + "mean_token_accuracy": 0.9505287684500218, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3488145174328671, + "eval_loss": 0.6612305641174316, + "eval_mean_token_accuracy": 0.8492907808963642, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6927, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 2200 + }, + { + "entropy": 0.23091202937066554, + "epoch": 5.523038605230386, + "grad_norm": 0.8909686207771301, + "learning_rate": 0.00011235380014440985, + "loss": 0.15150139331817628, + "mean_token_accuracy": 0.9497875183820724, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.3268539015810157, + "eval_loss": 0.6667542457580566, + "eval_mean_token_accuracy": 0.8499062903398691, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.4644, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 2220 + }, + { + "entropy": 0.2227974807843566, + "epoch": 5.572851805728518, + "grad_norm": 0.6180275082588196, + "learning_rate": 0.0001103892282299158, + "loss": 0.1491069197654724, + "mean_token_accuracy": 0.9488144010305405, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3346347655494546, + "eval_loss": 0.6665948629379272, + "eval_mean_token_accuracy": 0.8499961893918903, + "eval_num_tokens": 5226864.0, + "eval_runtime": 87.0548, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.976, + "step": 2240 + }, + { + "entropy": 0.21368421968072654, + "epoch": 5.62266500622665, + "grad_norm": 0.6004369258880615, + "learning_rate": 0.00010842548582877651, + "loss": 0.14485255479812623, + "mean_token_accuracy": 0.9502056457102299, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.32753298804163933, + "eval_loss": 0.6680151224136353, + "eval_mean_token_accuracy": 0.8515451086121936, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.8524, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.98, + "step": 2260 + }, + { + "entropy": 0.2103635374456644, + "epoch": 5.672478206724782, + "grad_norm": 0.699174702167511, + "learning_rate": 0.00010646316517891613, + "loss": 0.14297772645950318, + "mean_token_accuracy": 0.9512537539005279, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.32966585959806, + "eval_loss": 0.675578773021698, + "eval_mean_token_accuracy": 0.8509623023659684, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.4518, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.99, + "step": 2280 + }, + { + "entropy": 0.22516900151968003, + "epoch": 5.722291407222914, + "grad_norm": 0.6637354493141174, + "learning_rate": 0.00010450285808947797, + "loss": 0.15202572345733642, + "mean_token_accuracy": 0.9482452072203159, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3369456917740578, + "eval_loss": 0.6697061061859131, + "eval_mean_token_accuracy": 0.848603522361711, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.6371, + "eval_samples_per_second": 15.871, + "eval_steps_per_second": 1.985, + "step": 2300 + }, + { + "entropy": 0.21841065725311637, + "epoch": 5.772104607721046, + "grad_norm": 0.7940268516540527, + "learning_rate": 0.00010254515576234297, + "loss": 0.14710167646408082, + "mean_token_accuracy": 0.9493498183786869, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3237486180177955, + "eval_loss": 0.6779657602310181, + "eval_mean_token_accuracy": 0.8500715313955794, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.1826, + "eval_samples_per_second": 15.954, + "eval_steps_per_second": 1.996, + "step": 2320 + }, + { + "entropy": 0.22146204356104135, + "epoch": 5.821917808219178, + "grad_norm": 0.9234833121299744, + "learning_rate": 0.00010059064861383132, + "loss": 0.14720046520233154, + "mean_token_accuracy": 0.9493872679769992, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.32365207564692167, + "eval_loss": 0.6704005002975464, + "eval_mean_token_accuracy": 0.8507985760306203, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.5494, + "eval_samples_per_second": 15.887, + "eval_steps_per_second": 1.987, + "step": 2340 + }, + { + "entropy": 0.20934011954814197, + "epoch": 5.87173100871731, + "grad_norm": 0.5547503232955933, + "learning_rate": 9.863992609664084e-05, + "loss": 0.1464867353439331, + "mean_token_accuracy": 0.9503875687718392, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.3330401429083458, + "eval_loss": 0.6659091114997864, + "eval_mean_token_accuracy": 0.8504848906467127, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.5855, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 2360 + }, + { + "entropy": 0.21678635366261007, + "epoch": 5.921544209215442, + "grad_norm": 0.570612907409668, + "learning_rate": 9.669357652207635e-05, + "loss": 0.14821385145187377, + "mean_token_accuracy": 0.9503940217196941, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3322022325077722, + "eval_loss": 0.6722489595413208, + "eval_mean_token_accuracy": 0.8489979422369669, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.2986, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 2380 + }, + { + "entropy": 0.20932920072227718, + "epoch": 5.971357409713574, + "grad_norm": 0.7879557609558105, + "learning_rate": 9.475218688262262e-05, + "loss": 0.14675841331481934, + "mean_token_accuracy": 0.9507176131010056, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.3199348642902319, + "eval_loss": 0.6698136329650879, + "eval_mean_token_accuracy": 0.8514142130003419, + "eval_num_tokens": 5605400.0, + "eval_runtime": 85.8995, + "eval_samples_per_second": 16.007, + "eval_steps_per_second": 2.002, + "step": 2400 + }, + { + "entropy": 0.21032143919131693, + "epoch": 6.019925280199253, + "grad_norm": 0.5823076367378235, + "learning_rate": 9.281634267491569e-05, + "loss": 0.13322267532348633, + "mean_token_accuracy": 0.9550939072401096, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.30206270117399303, + "eval_loss": 0.7093168497085571, + "eval_mean_token_accuracy": 0.8500627639681794, + "eval_num_tokens": 5648968.0, + "eval_runtime": 85.8128, + "eval_samples_per_second": 16.023, + "eval_steps_per_second": 2.004, + "step": 2420 + }, + { + "entropy": 0.1534628233872354, + "epoch": 6.069738480697385, + "grad_norm": 0.710133969783783, + "learning_rate": 9.088662772316508e-05, + "loss": 0.09078952670097351, + "mean_token_accuracy": 0.9678447999060154, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.28208133101809857, + "eval_loss": 0.7636417150497437, + "eval_mean_token_accuracy": 0.8494061477655588, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9724, + "eval_samples_per_second": 15.994, + "eval_steps_per_second": 2.001, + "step": 2440 + }, + { + "entropy": 0.16151462448760867, + "epoch": 6.119551681195516, + "grad_norm": 0.5793812274932861, + "learning_rate": 8.896362400308028e-05, + "loss": 0.09545697569847107, + "mean_token_accuracy": 0.9671573750674725, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.2833245605403601, + "eval_loss": 0.7402405738830566, + "eval_mean_token_accuracy": 0.8503523728875226, + "eval_num_tokens": 5745090.0, + "eval_runtime": 85.5461, + "eval_samples_per_second": 16.073, + "eval_steps_per_second": 2.011, + "step": 2460 + }, + { + "entropy": 0.15203177919611335, + "epoch": 6.169364881693649, + "grad_norm": 0.4251123368740082, + "learning_rate": 8.704791146635483e-05, + "loss": 0.09420782327651978, + "mean_token_accuracy": 0.9677386932075024, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.28572545962971313, + "eval_loss": 0.735416829586029, + "eval_mean_token_accuracy": 0.8487084663884584, + "eval_num_tokens": 5790333.0, + "eval_runtime": 85.4801, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.012, + "step": 2480 + }, + { + "entropy": 0.15587336672469973, + "epoch": 6.219178082191781, + "grad_norm": 0.4357028007507324, + "learning_rate": 8.514006786576085e-05, + "loss": 0.09429320096969604, + "mean_token_accuracy": 0.9682952925562859, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.2859006894882335, + "eval_loss": 0.7347224950790405, + "eval_mean_token_accuracy": 0.8501905518215757, + "eval_num_tokens": 5837321.0, + "eval_runtime": 85.7578, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.006, + "step": 2500 + }, + { + "entropy": 0.15765639198943973, + "epoch": 6.268991282689913, + "grad_norm": 0.47331130504608154, + "learning_rate": 8.324066858090663e-05, + "loss": 0.09571113586425781, + "mean_token_accuracy": 0.9683481335639954, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.29231513846059176, + "eval_loss": 0.7392512559890747, + "eval_mean_token_accuracy": 0.8486633983462356, + "eval_num_tokens": 5884398.0, + "eval_runtime": 85.7846, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.005, + "step": 2520 + }, + { + "entropy": 0.16176860257983208, + "epoch": 6.318804483188045, + "grad_norm": 0.6142018437385559, + "learning_rate": 8.135028644470992e-05, + "loss": 0.09486144185066223, + "mean_token_accuracy": 0.9682316601276397, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.2851274753379267, + "eval_loss": 0.7520816922187805, + "eval_mean_token_accuracy": 0.8501113649717597, + "eval_num_tokens": 5929876.0, + "eval_runtime": 85.9425, + "eval_samples_per_second": 15.999, + "eval_steps_per_second": 2.001, + "step": 2540 + }, + { + "entropy": 0.15404034564271568, + "epoch": 6.3686176836861765, + "grad_norm": 0.6051287651062012, + "learning_rate": 7.946949157063964e-05, + "loss": 0.09280472993850708, + "mean_token_accuracy": 0.9684635892510414, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28802703563557114, + "eval_loss": 0.7439162135124207, + "eval_mean_token_accuracy": 0.8499851770872293, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.0703, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.998, + "step": 2560 + }, + { + "entropy": 0.15343588953837753, + "epoch": 6.418430884184309, + "grad_norm": 0.4823743402957916, + "learning_rate": 7.759885118077701e-05, + "loss": 0.09000591039657593, + "mean_token_accuracy": 0.9699928767979145, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2795634938533916, + "eval_loss": 0.7647850513458252, + "eval_mean_token_accuracy": 0.8503464397995971, + "eval_num_tokens": 6025380.0, + "eval_runtime": 85.8886, + "eval_samples_per_second": 16.009, + "eval_steps_per_second": 2.003, + "step": 2580 + }, + { + "entropy": 0.15740026142448188, + "epoch": 6.468244084682441, + "grad_norm": 0.5082696676254272, + "learning_rate": 7.57389294347494e-05, + "loss": 0.09191849827766418, + "mean_token_accuracy": 0.9692809768021107, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2913342311458532, + "eval_loss": 0.7518694996833801, + "eval_mean_token_accuracy": 0.8483168302580367, + "eval_num_tokens": 6073349.0, + "eval_runtime": 85.5761, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.01, + "step": 2600 + }, + { + "entropy": 0.15922069251537324, + "epoch": 6.518057285180573, + "grad_norm": 0.3995199501514435, + "learning_rate": 7.389028725958736e-05, + "loss": 0.09584367871284485, + "mean_token_accuracy": 0.9685114495456218, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.2863075934177221, + "eval_loss": 0.7539381384849548, + "eval_mean_token_accuracy": 0.8507507083027862, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.112, + "eval_samples_per_second": 15.968, + "eval_steps_per_second": 1.997, + "step": 2620 + }, + { + "entropy": 0.16197575423866512, + "epoch": 6.567870485678705, + "grad_norm": 0.534295380115509, + "learning_rate": 7.205348218055678e-05, + "loss": 0.0961170256137848, + "mean_token_accuracy": 0.9674530044198036, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.29021967315050057, + "eval_loss": 0.751198947429657, + "eval_mean_token_accuracy": 0.8509796344956686, + "eval_num_tokens": 6165523.0, + "eval_runtime": 85.7958, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.005, + "step": 2640 + }, + { + "entropy": 0.15261746793985367, + "epoch": 6.617683686176837, + "grad_norm": 0.5391237139701843, + "learning_rate": 7.022906815301673e-05, + "loss": 0.0926026999950409, + "mean_token_accuracy": 0.9695659473538398, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.29128045216202736, + "eval_loss": 0.7450292110443115, + "eval_mean_token_accuracy": 0.8498771443616512, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.3963, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 2660 + }, + { + "entropy": 0.16164180357009172, + "epoch": 6.667496886674969, + "grad_norm": 0.5767946243286133, + "learning_rate": 6.841759539535419e-05, + "loss": 0.09291981458663941, + "mean_token_accuracy": 0.9687136687338352, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2897637223088464, + "eval_loss": 0.7503410577774048, + "eval_mean_token_accuracy": 0.8503315164599308, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.0653, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.998, + "step": 2680 + }, + { + "entropy": 0.17062523355707526, + "epoch": 6.717310087173101, + "grad_norm": 0.4974168539047241, + "learning_rate": 6.661961022304563e-05, + "loss": 0.09713236689567566, + "mean_token_accuracy": 0.9661971725523472, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2765843396963075, + "eval_loss": 0.7604002356529236, + "eval_mean_token_accuracy": 0.8521115277395692, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.1676, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 2700 + }, + { + "entropy": 0.17544092936441302, + "epoch": 6.767123287671232, + "grad_norm": 0.5523537993431091, + "learning_rate": 6.483565488389582e-05, + "loss": 0.09709116220474243, + "mean_token_accuracy": 0.9650957375764847, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.27939334659035814, + "eval_loss": 0.7534670829772949, + "eval_mean_token_accuracy": 0.851230604010959, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.2913, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 2720 + }, + { + "entropy": 0.15991022661328316, + "epoch": 6.816936488169365, + "grad_norm": 0.478551983833313, + "learning_rate": 6.306626739450311e-05, + "loss": 0.09564646482467651, + "mean_token_accuracy": 0.9679084822535515, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.27878295491601146, + "eval_loss": 0.7519959211349487, + "eval_mean_token_accuracy": 0.8510654949864676, + "eval_num_tokens": 6397720.0, + "eval_runtime": 85.9109, + "eval_samples_per_second": 16.005, + "eval_steps_per_second": 2.002, + "step": 2740 + }, + { + "entropy": 0.16824879590421915, + "epoch": 6.866749688667497, + "grad_norm": 0.6681098937988281, + "learning_rate": 6.131198137800108e-05, + "loss": 0.0962279736995697, + "mean_token_accuracy": 0.966830012947321, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.2834690434121808, + "eval_loss": 0.751922070980072, + "eval_mean_token_accuracy": 0.8521237577809844, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.3618, + "eval_samples_per_second": 15.921, + "eval_steps_per_second": 1.992, + "step": 2760 + }, + { + "entropy": 0.1518704930320382, + "epoch": 6.916562889165629, + "grad_norm": 0.5201290249824524, + "learning_rate": 5.957332590312513e-05, + "loss": 0.09010660648345947, + "mean_token_accuracy": 0.9693463340401649, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.28485129617674404, + "eval_loss": 0.7452457547187805, + "eval_mean_token_accuracy": 0.8512036796919135, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.4524, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.99, + "step": 2780 + }, + { + "entropy": 0.15512610590085388, + "epoch": 6.966376089663761, + "grad_norm": 0.42802050709724426, + "learning_rate": 5.785082532465233e-05, + "loss": 0.09320432543754578, + "mean_token_accuracy": 0.9686134628951549, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.27554594526110693, + "eval_loss": 0.7644653916358948, + "eval_mean_token_accuracy": 0.8513738523389018, + "eval_num_tokens": 6540175.0, + "eval_runtime": 85.7609, + "eval_samples_per_second": 16.033, + "eval_steps_per_second": 2.006, + "step": 2800 + }, + { + "entropy": 0.17524497526196334, + "epoch": 7.01494396014944, + "grad_norm": 0.3330269157886505, + "learning_rate": 5.6144999125263545e-05, + "loss": 0.0895616888999939, + "mean_token_accuracy": 0.9682766932707566, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.2735865569218647, + "eval_loss": 0.768479585647583, + "eval_mean_token_accuracy": 0.8503459383581959, + "eval_num_tokens": 6583767.0, + "eval_runtime": 85.7162, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.007, + "step": 2820 + }, + { + "entropy": 0.1403565663844347, + "epoch": 7.064757160647572, + "grad_norm": 0.35613498091697693, + "learning_rate": 5.4456361758874235e-05, + "loss": 0.07551313638687134, + "mean_token_accuracy": 0.9739301167428493, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.25941789089593775, + "eval_loss": 0.8209511637687683, + "eval_mean_token_accuracy": 0.8505055855873019, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.0943, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 2840 + }, + { + "entropy": 0.13500106502324344, + "epoch": 7.114570361145703, + "grad_norm": 0.34418627619743347, + "learning_rate": 5.2785422495482234e-05, + "loss": 0.07293946146965027, + "mean_token_accuracy": 0.9747208289802074, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.26482899772912954, + "eval_loss": 0.798904538154602, + "eval_mean_token_accuracy": 0.8511530233677044, + "eval_num_tokens": 6672946.0, + "eval_runtime": 85.7915, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.005, + "step": 2860 + }, + { + "entropy": 0.13127502552233636, + "epoch": 7.164383561643835, + "grad_norm": 0.4638441503047943, + "learning_rate": 5.113268526757892e-05, + "loss": 0.07121461629867554, + "mean_token_accuracy": 0.9756786689162255, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2645381211714689, + "eval_loss": 0.809101939201355, + "eval_mean_token_accuracy": 0.8514727898115335, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.84, + "eval_samples_per_second": 16.018, + "eval_steps_per_second": 2.004, + "step": 2880 + }, + { + "entropy": 0.1331390908919275, + "epoch": 7.214196762141968, + "grad_norm": 0.40206775069236755, + "learning_rate": 4.949864851817007e-05, + "loss": 0.07188264131546021, + "mean_token_accuracy": 0.9755406074225903, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.26244733283339544, + "eval_loss": 0.8143188953399658, + "eval_mean_token_accuracy": 0.8514358189909957, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.8546, + "eval_samples_per_second": 16.015, + "eval_steps_per_second": 2.003, + "step": 2900 + }, + { + "entropy": 0.13647331558167936, + "epoch": 7.2640099626401, + "grad_norm": 0.26405787467956543, + "learning_rate": 4.788380505045224e-05, + "loss": 0.07412450313568116, + "mean_token_accuracy": 0.9744274213910102, + "num_tokens": 6809678.0, + "step": 2920 + }, + { + "epoch": 7.2640099626401, + "eval_entropy": 0.2626111418182074, + "eval_loss": 0.8111525177955627, + "eval_mean_token_accuracy": 0.8512121695418691, + "eval_num_tokens": 6809678.0, + "eval_runtime": 85.9626, + "eval_samples_per_second": 15.995, + "eval_steps_per_second": 2.001, + "step": 2920 + }, + { + "entropy": 0.12644002586603165, + "epoch": 7.313823163138232, + "grad_norm": 0.27514681220054626, + "learning_rate": 4.6288641879189884e-05, + "loss": 0.06807711124420165, + "mean_token_accuracy": 0.9760703906416893, + "num_tokens": 6860750.0, + "step": 2940 + }, + { + "epoch": 7.313823163138232, + "eval_entropy": 0.26096762734097106, + "eval_loss": 0.8184595108032227, + "eval_mean_token_accuracy": 0.8501476153384807, + "eval_num_tokens": 6860750.0, + "eval_runtime": 85.9521, + "eval_samples_per_second": 15.997, + "eval_steps_per_second": 2.001, + "step": 2940 + }, + { + "entropy": 0.13920630998909472, + "epoch": 7.363636363636363, + "grad_norm": 0.23584705591201782, + "learning_rate": 4.4713640083838604e-05, + "loss": 0.07301607131958007, + "mean_token_accuracy": 0.9745715200901032, + "num_tokens": 6907092.0, + "step": 2960 + }, + { + "epoch": 7.363636363636363, + "eval_entropy": 0.2612536767021168, + "eval_loss": 0.8116245269775391, + "eval_mean_token_accuracy": 0.8510967350976412, + "eval_num_tokens": 6907092.0, + "eval_runtime": 85.6373, + "eval_samples_per_second": 16.056, + "eval_steps_per_second": 2.008, + "step": 2960 + }, + { + "entropy": 0.1349492883309722, + "epoch": 7.4134495641344955, + "grad_norm": 0.24552719295024872, + "learning_rate": 4.315927466345791e-05, + "loss": 0.07397544980049134, + "mean_token_accuracy": 0.9745095103979111, + "num_tokens": 6952700.0, + "step": 2980 + }, + { + "epoch": 7.4134495641344955, + "eval_entropy": 0.25796533306670744, + "eval_loss": 0.8266491293907166, + "eval_mean_token_accuracy": 0.8511653857868772, + "eval_num_tokens": 6952700.0, + "eval_runtime": 85.7462, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.006, + "step": 2980 + }, + { + "entropy": 0.14479175000451505, + "epoch": 7.463262764632628, + "grad_norm": 0.2846072018146515, + "learning_rate": 4.162601439345814e-05, + "loss": 0.07544798254966736, + "mean_token_accuracy": 0.9727819666266442, + "num_tokens": 6996430.0, + "step": 3000 + }, + { + "epoch": 7.463262764632628, + "eval_entropy": 0.2584348309698493, + "eval_loss": 0.8253348469734192, + "eval_mean_token_accuracy": 0.8511569815319638, + "eval_num_tokens": 6996430.0, + "eval_runtime": 86.2984, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 3000 + }, + { + "entropy": 0.14114196319133043, + "epoch": 7.51307596513076, + "grad_norm": 0.407966285943985, + "learning_rate": 4.011432168422419e-05, + "loss": 0.0736398994922638, + "mean_token_accuracy": 0.9741654269397259, + "num_tokens": 7042038.0, + "step": 3020 + }, + { + "epoch": 7.51307596513076, + "eval_entropy": 0.25232676260693127, + "eval_loss": 0.8296052813529968, + "eval_mean_token_accuracy": 0.8523298349491385, + "eval_num_tokens": 7042038.0, + "eval_runtime": 85.8445, + "eval_samples_per_second": 16.017, + "eval_steps_per_second": 2.004, + "step": 3020 + }, + { + "entropy": 0.1353456223383546, + "epoch": 7.562889165628892, + "grad_norm": 0.2712634801864624, + "learning_rate": 3.8624652441658684e-05, + "loss": 0.07362412214279175, + "mean_token_accuracy": 0.9747945807874203, + "num_tokens": 7089390.0, + "step": 3040 + }, + { + "epoch": 7.562889165628892, + "eval_entropy": 0.2579477243991785, + "eval_loss": 0.8274564743041992, + "eval_mean_token_accuracy": 0.8517705212498821, + "eval_num_tokens": 7089390.0, + "eval_runtime": 85.8222, + "eval_samples_per_second": 16.022, + "eval_steps_per_second": 2.004, + "step": 3040 + }, + { + "entropy": 0.1296080862637609, + "epoch": 7.6127023661270234, + "grad_norm": 0.2371893972158432, + "learning_rate": 3.715745592968707e-05, + "loss": 0.06971035599708557, + "mean_token_accuracy": 0.9759043246507645, + "num_tokens": 7138002.0, + "step": 3060 + }, + { + "epoch": 7.6127023661270234, + "eval_entropy": 0.25391967083479083, + "eval_loss": 0.8197130560874939, + "eval_mean_token_accuracy": 0.8522267875283264, + "eval_num_tokens": 7138002.0, + "eval_runtime": 85.8796, + "eval_samples_per_second": 16.011, + "eval_steps_per_second": 2.003, + "step": 3060 + }, + { + "entropy": 0.1311203008517623, + "epoch": 7.662515566625156, + "grad_norm": 0.22499267756938934, + "learning_rate": 3.5713174634765967e-05, + "loss": 0.07176244258880615, + "mean_token_accuracy": 0.9754939571022987, + "num_tokens": 7185520.0, + "step": 3080 + }, + { + "epoch": 7.662515566625156, + "eval_entropy": 0.2526215241225653, + "eval_loss": 0.8265154361724854, + "eval_mean_token_accuracy": 0.8519952584837758, + "eval_num_tokens": 7185520.0, + "eval_runtime": 85.8746, + "eval_samples_per_second": 16.012, + "eval_steps_per_second": 2.003, + "step": 3080 + }, + { + "entropy": 0.13420484317466616, + "epoch": 7.712328767123288, + "grad_norm": 0.2398064285516739, + "learning_rate": 3.4292244132434866e-05, + "loss": 0.07559212446212768, + "mean_token_accuracy": 0.9743142127990723, + "num_tokens": 7232170.0, + "step": 3100 + }, + { + "epoch": 7.712328767123288, + "eval_entropy": 0.2484562756537005, + "eval_loss": 0.8312150239944458, + "eval_mean_token_accuracy": 0.8528405119513356, + "eval_num_tokens": 7232170.0, + "eval_runtime": 85.7896, + "eval_samples_per_second": 16.028, + "eval_steps_per_second": 2.005, + "step": 3100 + }, + { + "entropy": 0.11965563679113984, + "epoch": 7.76214196762142, + "grad_norm": 0.3408384919166565, + "learning_rate": 3.2895092955952746e-05, + "loss": 0.0661750853061676, + "mean_token_accuracy": 0.9776600524783134, + "num_tokens": 7282846.0, + "step": 3120 + }, + { + "epoch": 7.76214196762142, + "eval_entropy": 0.2522421533804993, + "eval_loss": 0.8327009677886963, + "eval_mean_token_accuracy": 0.8524222023958383, + "eval_num_tokens": 7282846.0, + "eval_runtime": 86.1769, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 1.996, + "step": 3120 + }, + { + "entropy": 0.13388084415346385, + "epoch": 7.811955168119551, + "grad_norm": 0.35418516397476196, + "learning_rate": 3.152214246705829e-05, + "loss": 0.07149899601936341, + "mean_token_accuracy": 0.9747635535895824, + "num_tokens": 7331518.0, + "step": 3140 + }, + { + "epoch": 7.811955168119551, + "eval_entropy": 0.25038352296795957, + "eval_loss": 0.836457371711731, + "eval_mean_token_accuracy": 0.8526130665180295, + "eval_num_tokens": 7331518.0, + "eval_runtime": 85.6099, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.009, + "step": 3140 + }, + { + "entropy": 0.13530643959529698, + "epoch": 7.861768368617684, + "grad_norm": 0.38060539960861206, + "learning_rate": 3.017380672889291e-05, + "loss": 0.07116585969924927, + "mean_token_accuracy": 0.973284512758255, + "num_tokens": 7379056.0, + "step": 3160 + }, + { + "epoch": 7.861768368617684, + "eval_entropy": 0.255092611319797, + "eval_loss": 0.8314701914787292, + "eval_mean_token_accuracy": 0.8520913099826768, + "eval_num_tokens": 7379056.0, + "eval_runtime": 85.877, + "eval_samples_per_second": 16.011, + "eval_steps_per_second": 2.003, + "step": 3160 + }, + { + "entropy": 0.13383390177041293, + "epoch": 7.911581569115816, + "grad_norm": 0.3827536106109619, + "learning_rate": 2.8850492381124808e-05, + "loss": 0.07305437326431274, + "mean_token_accuracy": 0.9750778004527092, + "num_tokens": 7424770.0, + "step": 3180 + }, + { + "epoch": 7.911581569115816, + "eval_entropy": 0.25416371157003004, + "eval_loss": 0.8206402063369751, + "eval_mean_token_accuracy": 0.852779901651449, + "eval_num_tokens": 7424770.0, + "eval_runtime": 86.1015, + "eval_samples_per_second": 15.97, + "eval_steps_per_second": 1.998, + "step": 3180 + }, + { + "entropy": 0.1395680439658463, + "epoch": 7.961394769613948, + "grad_norm": 0.3809775412082672, + "learning_rate": 2.7552598517312256e-05, + "loss": 0.07236042022705078, + "mean_token_accuracy": 0.9731538116931915, + "num_tokens": 7470804.0, + "step": 3200 + }, + { + "epoch": 7.961394769613948, + "eval_entropy": 0.25528111975899964, + "eval_loss": 0.8230037093162537, + "eval_mean_token_accuracy": 0.8526452603035195, + "eval_num_tokens": 7470804.0, + "eval_runtime": 85.7895, + "eval_samples_per_second": 16.028, + "eval_steps_per_second": 2.005, + "step": 3200 + }, + { + "entropy": 0.12193699864049752, + "epoch": 8.009962640099626, + "grad_norm": 0.11854425817728043, + "learning_rate": 2.6280516564542205e-05, + "loss": 0.06617764234542847, + "mean_token_accuracy": 0.977179691577569, + "num_tokens": 7518110.0, + "step": 3220 + }, + { + "epoch": 8.009962640099626, + "eval_entropy": 0.25100527677771656, + "eval_loss": 0.8393343687057495, + "eval_mean_token_accuracy": 0.8522553132023922, + "eval_num_tokens": 7518110.0, + "eval_runtime": 85.8837, + "eval_samples_per_second": 16.01, + "eval_steps_per_second": 2.003, + "step": 3220 + }, + { + "entropy": 0.12788885813206435, + "epoch": 8.059775840597759, + "grad_norm": 0.16094881296157837, + "learning_rate": 2.50346301653812e-05, + "loss": 0.06274186968803405, + "mean_token_accuracy": 0.9766994707286358, + "num_tokens": 7565539.0, + "step": 3240 + }, + { + "epoch": 8.059775840597759, + "eval_entropy": 0.24409458682287571, + "eval_loss": 0.874617338180542, + "eval_mean_token_accuracy": 0.8521041180505309, + "eval_num_tokens": 7565539.0, + "eval_runtime": 86.2656, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 3240 + }, + { + "entropy": 0.12464155335910618, + "epoch": 8.10958904109589, + "grad_norm": 0.16893954575061798, + "learning_rate": 2.381531506217437e-05, + "loss": 0.06093020439147949, + "mean_token_accuracy": 0.9776258453726768, + "num_tokens": 7612578.0, + "step": 3260 + }, + { + "epoch": 8.10958904109589, + "eval_entropy": 0.24396493017326953, + "eval_loss": 0.891161322593689, + "eval_mean_token_accuracy": 0.8515338024427724, + "eval_num_tokens": 7612578.0, + "eval_runtime": 85.9061, + "eval_samples_per_second": 16.006, + "eval_steps_per_second": 2.002, + "step": 3260 + }, + { + "entropy": 0.12345920228399336, + "epoch": 8.159402241594023, + "grad_norm": 0.14332273602485657, + "learning_rate": 2.262293898372616e-05, + "loss": 0.061289966106414795, + "mean_token_accuracy": 0.9762230902910233, + "num_tokens": 7660157.0, + "step": 3280 + }, + { + "epoch": 8.159402241594023, + "eval_entropy": 0.2481445314059424, + "eval_loss": 0.8922848105430603, + "eval_mean_token_accuracy": 0.8514944855556932, + "eval_num_tokens": 7660157.0, + "eval_runtime": 85.5201, + "eval_samples_per_second": 16.078, + "eval_steps_per_second": 2.011, + "step": 3280 + }, + { + "entropy": 0.12298110066913068, + "epoch": 8.209215442092155, + "grad_norm": 0.21848882734775543, + "learning_rate": 2.1457861534398633e-05, + "loss": 0.05986443758010864, + "mean_token_accuracy": 0.9786281704902648, + "num_tokens": 7709745.0, + "step": 3300 + }, + { + "epoch": 8.209215442092155, + "eval_entropy": 0.24329388124305149, + "eval_loss": 0.9021085500717163, + "eval_mean_token_accuracy": 0.8521762625422589, + "eval_num_tokens": 7709745.0, + "eval_runtime": 85.955, + "eval_samples_per_second": 15.997, + "eval_steps_per_second": 2.001, + "step": 3300 + }, + { + "entropy": 0.13265180448070168, + "epoch": 8.259028642590286, + "grad_norm": 0.18067947030067444, + "learning_rate": 2.0320434085659692e-05, + "loss": 0.06724961400032044, + "mean_token_accuracy": 0.975098168104887, + "num_tokens": 7753571.0, + "step": 3320 + }, + { + "epoch": 8.259028642590286, + "eval_entropy": 0.2433211464694766, + "eval_loss": 0.9094350337982178, + "eval_mean_token_accuracy": 0.8520150094531304, + "eval_num_tokens": 7753571.0, + "eval_runtime": 85.7989, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.005, + "step": 3320 + }, + { + "entropy": 0.11949320202693343, + "epoch": 8.308841843088418, + "grad_norm": 0.17020289599895477, + "learning_rate": 1.9210999670114196e-05, + "loss": 0.0634455680847168, + "mean_token_accuracy": 0.9771294385194779, + "num_tokens": 7799310.0, + "step": 3340 + }, + { + "epoch": 8.308841843088418, + "eval_entropy": 0.24345201219237128, + "eval_loss": 0.9021793603897095, + "eval_mean_token_accuracy": 0.8520745697409607, + "eval_num_tokens": 7799310.0, + "eval_runtime": 86.0883, + "eval_samples_per_second": 15.972, + "eval_steps_per_second": 1.998, + "step": 3340 + }, + { + "entropy": 0.12065747743472457, + "epoch": 8.35865504358655, + "grad_norm": 0.16789060831069946, + "learning_rate": 1.8129892878049886e-05, + "loss": 0.061494195461273195, + "mean_token_accuracy": 0.9779584899544715, + "num_tokens": 7846447.0, + "step": 3360 + }, + { + "epoch": 8.35865504358655, + "eval_entropy": 0.24093415042342142, + "eval_loss": 0.9006755352020264, + "eval_mean_token_accuracy": 0.852174230786257, + "eval_num_tokens": 7846447.0, + "eval_runtime": 85.9011, + "eval_samples_per_second": 16.007, + "eval_steps_per_second": 2.002, + "step": 3360 + }, + { + "entropy": 0.13125578537583352, + "epoch": 8.408468244084682, + "grad_norm": 0.1662452220916748, + "learning_rate": 1.70774397565298e-05, + "loss": 0.06685600876808166, + "mean_token_accuracy": 0.9744067586958408, + "num_tokens": 7890283.0, + "step": 3380 + }, + { + "epoch": 8.408468244084682, + "eval_entropy": 0.24062153688350388, + "eval_loss": 0.9078915119171143, + "eval_mean_token_accuracy": 0.8523201647886011, + "eval_num_tokens": 7890283.0, + "eval_runtime": 86.0201, + "eval_samples_per_second": 15.985, + "eval_steps_per_second": 2.0, + "step": 3380 + }, + { + "entropy": 0.11986117120832204, + "epoch": 8.458281444582815, + "grad_norm": 0.19571948051452637, + "learning_rate": 1.6053957711060606e-05, + "loss": 0.06411095261573792, + "mean_token_accuracy": 0.9770627245306969, + "num_tokens": 7936518.0, + "step": 3400 + }, + { + "epoch": 8.458281444582815, + "eval_entropy": 0.24352820347561394, + "eval_loss": 0.9058943390846252, + "eval_mean_token_accuracy": 0.8519382792156797, + "eval_num_tokens": 7936518.0, + "eval_runtime": 85.966, + "eval_samples_per_second": 15.995, + "eval_steps_per_second": 2.001, + "step": 3400 + }, + { + "entropy": 0.12857897616922856, + "epoch": 8.508094645080947, + "grad_norm": 0.2609264850616455, + "learning_rate": 1.5059755409867613e-05, + "loss": 0.06473397612571716, + "mean_token_accuracy": 0.9764650195837021, + "num_tokens": 7981966.0, + "step": 3420 + }, + { + "epoch": 8.508094645080947, + "eval_entropy": 0.24032609000108962, + "eval_loss": 0.9077776074409485, + "eval_mean_token_accuracy": 0.8517829197090726, + "eval_num_tokens": 7981966.0, + "eval_runtime": 86.6059, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 3420 + }, + { + "entropy": 0.12348870886489749, + "epoch": 8.557907845579079, + "grad_norm": 0.19537609815597534, + "learning_rate": 1.409513269080473e-05, + "loss": 0.06481348872184753, + "mean_token_accuracy": 0.9769559659063816, + "num_tokens": 8028367.0, + "step": 3440 + }, + { + "epoch": 8.557907845579079, + "eval_entropy": 0.2404322574824788, + "eval_loss": 0.9057720899581909, + "eval_mean_token_accuracy": 0.8521037981953732, + "eval_num_tokens": 8028367.0, + "eval_runtime": 86.166, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.996, + "step": 3440 + }, + { + "entropy": 0.12040232736617326, + "epoch": 8.607721046077211, + "grad_norm": 0.3310582935810089, + "learning_rate": 1.3160380470927183e-05, + "loss": 0.06468871235847473, + "mean_token_accuracy": 0.9768650442361831, + "num_tokens": 8074934.0, + "step": 3460 + }, + { + "epoch": 8.607721046077211, + "eval_entropy": 0.24118655876711356, + "eval_loss": 0.9028318524360657, + "eval_mean_token_accuracy": 0.8521025340224422, + "eval_num_tokens": 8074934.0, + "eval_runtime": 85.3668, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.015, + "step": 3460 + }, + { + "entropy": 0.12328103906475008, + "epoch": 8.657534246575342, + "grad_norm": 0.12836167216300964, + "learning_rate": 1.2255780658755122e-05, + "loss": 0.06229386329650879, + "mean_token_accuracy": 0.9763277888298034, + "num_tokens": 8122775.0, + "step": 3480 + }, + { + "epoch": 8.657534246575342, + "eval_entropy": 0.24194598145956217, + "eval_loss": 0.9009329080581665, + "eval_mean_token_accuracy": 0.8521693289973015, + "eval_num_tokens": 8122775.0, + "eval_runtime": 85.9415, + "eval_samples_per_second": 15.999, + "eval_steps_per_second": 2.001, + "step": 3480 + }, + { + "entropy": 0.11321646976284683, + "epoch": 8.707347447073474, + "grad_norm": 0.15656894445419312, + "learning_rate": 1.1381606069253786e-05, + "loss": 0.05908188819885254, + "mean_token_accuracy": 0.9779504477977753, + "num_tokens": 8174307.0, + "step": 3500 + }, + { + "epoch": 8.707347447073474, + "eval_entropy": 0.24121542517528977, + "eval_loss": 0.9016091823577881, + "eval_mean_token_accuracy": 0.8521790667328724, + "eval_num_tokens": 8174307.0, + "eval_runtime": 85.7465, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.006, + "step": 3500 + }, + { + "entropy": 0.12657046681270004, + "epoch": 8.757160647571606, + "grad_norm": 0.22597502171993256, + "learning_rate": 1.053812034155629e-05, + "loss": 0.06244581937789917, + "mean_token_accuracy": 0.976795207709074, + "num_tokens": 8222808.0, + "step": 3520 + }, + { + "epoch": 8.757160647571606, + "eval_entropy": 0.23877542708502258, + "eval_loss": 0.9069110155105591, + "eval_mean_token_accuracy": 0.8522880177858264, + "eval_num_tokens": 8222808.0, + "eval_runtime": 85.7792, + "eval_samples_per_second": 16.03, + "eval_steps_per_second": 2.005, + "step": 3520 + }, + { + "entropy": 0.11422101808711886, + "epoch": 8.806973848069738, + "grad_norm": 0.21139323711395264, + "learning_rate": 9.725577859453502e-06, + "loss": 0.05988085865974426, + "mean_token_accuracy": 0.9779510758817196, + "num_tokens": 8273335.0, + "step": 3540 + }, + { + "epoch": 8.806973848069738, + "eval_entropy": 0.2393161087881687, + "eval_loss": 0.9033801555633545, + "eval_mean_token_accuracy": 0.8522614209457885, + "eval_num_tokens": 8273335.0, + "eval_runtime": 85.5594, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 3540 + }, + { + "entropy": 0.13810604228638113, + "epoch": 8.85678704856787, + "grad_norm": 0.24571993947029114, + "learning_rate": 8.944223674675537e-06, + "loss": 0.07036117911338806, + "mean_token_accuracy": 0.9734892748296261, + "num_tokens": 8315235.0, + "step": 3560 + }, + { + "epoch": 8.85678704856787, + "eval_entropy": 0.23998506947658782, + "eval_loss": 0.9009848833084106, + "eval_mean_token_accuracy": 0.8521793619837872, + "eval_num_tokens": 8315235.0, + "eval_runtime": 86.0974, + "eval_samples_per_second": 15.97, + "eval_steps_per_second": 1.998, + "step": 3560 + }, + { + "entropy": 0.14193559321574867, + "epoch": 8.906600249066003, + "grad_norm": 0.17304112017154694, + "learning_rate": 8.194293432987386e-06, + "loss": 0.07077967524528503, + "mean_token_accuracy": 0.973305893689394, + "num_tokens": 8358099.0, + "step": 3580 + }, + { + "epoch": 8.906600249066003, + "eval_entropy": 0.23883876689644748, + "eval_loss": 0.9015622138977051, + "eval_mean_token_accuracy": 0.8524864378363587, + "eval_num_tokens": 8358099.0, + "eval_runtime": 86.0089, + "eval_samples_per_second": 15.987, + "eval_steps_per_second": 2.0, + "step": 3580 + }, + { + "entropy": 0.11878943420015275, + "epoch": 8.956413449564135, + "grad_norm": 0.19075658917427063, + "learning_rate": 7.476013303121426e-06, + "loss": 0.060806107521057126, + "mean_token_accuracy": 0.9776863709092141, + "num_tokens": 8407430.0, + "step": 3600 + }, + { + "epoch": 8.956413449564135, + "eval_entropy": 0.23726526309931, + "eval_loss": 0.9060276746749878, + "eval_mean_token_accuracy": 0.8524192058762838, + "eval_num_tokens": 8407430.0, + "eval_runtime": 85.7252, + "eval_samples_per_second": 16.04, + "eval_steps_per_second": 2.006, + "step": 3600 + }, + { + "entropy": 0.1255835090787747, + "epoch": 9.004981320049813, + "grad_norm": 0.11608047038316727, + "learning_rate": 6.78959990856799e-06, + "loss": 0.06319612860679627, + "mean_token_accuracy": 0.9766685519462976, + "num_tokens": 8453175.0, + "step": 3620 + }, + { + "epoch": 9.004981320049813, + "eval_entropy": 0.2373251837006835, + "eval_loss": 0.9045722484588623, + "eval_mean_token_accuracy": 0.8525558363559634, + "eval_num_tokens": 8453175.0, + "eval_runtime": 85.7435, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.006, + "step": 3620 + }, + { + "entropy": 0.12587778437882663, + "epoch": 9.054794520547945, + "grad_norm": 0.1564614623785019, + "learning_rate": 6.135260262244683e-06, + "loss": 0.0630365788936615, + "mean_token_accuracy": 0.9777486085891723, + "num_tokens": 8497151.0, + "step": 3640 + }, + { + "epoch": 9.054794520547945, + "eval_entropy": 0.23559923721260803, + "eval_loss": 0.9120694398880005, + "eval_mean_token_accuracy": 0.8525292966947999, + "eval_num_tokens": 8497151.0, + "eval_runtime": 85.8018, + "eval_samples_per_second": 16.025, + "eval_steps_per_second": 2.005, + "step": 3640 + }, + { + "entropy": 0.12535365503281354, + "epoch": 9.104607721046078, + "grad_norm": 0.1404249221086502, + "learning_rate": 5.513191704064086e-06, + "loss": 0.060502654314041136, + "mean_token_accuracy": 0.9770058333873749, + "num_tokens": 8542996.0, + "step": 3660 + }, + { + "epoch": 9.104607721046078, + "eval_entropy": 0.23525122691725575, + "eval_loss": 0.9182237982749939, + "eval_mean_token_accuracy": 0.8524098333924316, + "eval_num_tokens": 8542996.0, + "eval_runtime": 85.9872, + "eval_samples_per_second": 15.991, + "eval_steps_per_second": 2.0, + "step": 3660 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.607405745129902e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3680/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3680/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3680/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3680/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3680/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3680/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3680/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3680/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3680/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3680/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3680/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3680/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3680/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3680/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..be6f5adccfc47dabe4fb481ef9f83a309ad84fda --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3680/trainer_state.json @@ -0,0 +1,3898 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 9.15442092154421, + "eval_steps": 20, + "global_step": 3680, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + }, + { + "entropy": 0.561330484598875, + "epoch": 1.891656288916563, + "grad_norm": 0.6722865700721741, + "learning_rate": 0.0002208867897174789, + "loss": 0.499837589263916, + "mean_token_accuracy": 0.8518734864890576, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.5865232653396074, + "eval_loss": 0.5437926650047302, + "eval_mean_token_accuracy": 0.8450997017843779, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4116, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.547389242425561, + "epoch": 1.9414694894146949, + "grad_norm": 0.7935577034950256, + "learning_rate": 0.00022027119820226907, + "loss": 0.4977591514587402, + "mean_token_accuracy": 0.8539491161704064, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.5290903090391048, + "eval_loss": 0.5409526824951172, + "eval_mean_token_accuracy": 0.8497545698354411, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.7262, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 780 + }, + { + "entropy": 0.5687909748405218, + "epoch": 1.9912826899128269, + "grad_norm": 0.6180546283721924, + "learning_rate": 0.00021962329729698345, + "loss": 0.5109643459320068, + "mean_token_accuracy": 0.8521598495543004, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.5503541858390321, + "eval_loss": 0.5361555218696594, + "eval_mean_token_accuracy": 0.8510884285666221, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.3339, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 800 + }, + { + "entropy": 0.4739728841261986, + "epoch": 2.0398505603985058, + "grad_norm": 0.8058829307556152, + "learning_rate": 0.0002189432823996982, + "loss": 0.4204097747802734, + "mean_token_accuracy": 0.8728981889211215, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.5077334992414297, + "eval_loss": 0.5531114339828491, + "eval_mean_token_accuracy": 0.8489257208136625, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.4801, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.989, + "step": 820 + }, + { + "entropy": 0.4594309840351343, + "epoch": 2.0896637608966375, + "grad_norm": 0.6906896829605103, + "learning_rate": 0.0002182313585936314, + "loss": 0.4071959495544434, + "mean_token_accuracy": 0.8732857562601566, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.49850136994622474, + "eval_loss": 0.5486204624176025, + "eval_mean_token_accuracy": 0.8507991450470548, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.3364, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.4881629109382629, + "epoch": 2.1394769613947697, + "grad_norm": 0.6343470215797424, + "learning_rate": 0.0002174877405852928, + "loss": 0.41669540405273436, + "mean_token_accuracy": 0.8711295068264008, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.49155513924914734, + "eval_loss": 0.555109441280365, + "eval_mean_token_accuracy": 0.8496399400539176, + "eval_num_tokens": 2008562.0, + "eval_runtime": 86.3295, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 860 + }, + { + "entropy": 0.4648668970912695, + "epoch": 2.1892901618929015, + "grad_norm": 0.8014165163040161, + "learning_rate": 0.00021671265263973133, + "loss": 0.4110250473022461, + "mean_token_accuracy": 0.8754166305065155, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.4909258722219356, + "eval_loss": 0.5539511442184448, + "eval_mean_token_accuracy": 0.8492401502160138, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.3468, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 880 + }, + { + "entropy": 0.4824485514312983, + "epoch": 2.2391033623910337, + "grad_norm": 0.6665191054344177, + "learning_rate": 0.00021590632851289967, + "loss": 0.4181404113769531, + "mean_token_accuracy": 0.8726993151009083, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.4986876940657926, + "eval_loss": 0.547695517539978, + "eval_mean_token_accuracy": 0.8501384708770486, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.3838, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 900 + }, + { + "entropy": 0.4751896943897009, + "epoch": 2.2889165628891655, + "grad_norm": 0.81158047914505, + "learning_rate": 0.00021506901138115678, + "loss": 0.40689678192138673, + "mean_token_accuracy": 0.8745221219956875, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.507153491121392, + "eval_loss": 0.5501641631126404, + "eval_mean_token_accuracy": 0.8495670116918032, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.0912, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 920 + }, + { + "entropy": 0.4873133715242147, + "epoch": 2.3387297633872977, + "grad_norm": 0.7218056321144104, + "learning_rate": 0.0002142009537679292, + "loss": 0.42701358795166017, + "mean_token_accuracy": 0.8695114746689796, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5202612736543943, + "eval_loss": 0.5491839051246643, + "eval_mean_token_accuracy": 0.8494071208460386, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.1142, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 940 + }, + { + "entropy": 0.4762951169162989, + "epoch": 2.3885429638854294, + "grad_norm": 0.7194424867630005, + "learning_rate": 0.0002133024174675534, + "loss": 0.42299847602844237, + "mean_token_accuracy": 0.8709790132939815, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4899340462546016, + "eval_loss": 0.5522511601448059, + "eval_mean_token_accuracy": 0.8492208258357159, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.463, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 960 + }, + { + "entropy": 0.49650347977876663, + "epoch": 2.4383561643835616, + "grad_norm": 0.8406022787094116, + "learning_rate": 0.0002123736734663221, + "loss": 0.4275330066680908, + "mean_token_accuracy": 0.8670595556497573, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.49691385654515996, + "eval_loss": 0.5491269826889038, + "eval_mean_token_accuracy": 0.850309816210769, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.17, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 980 + }, + { + "entropy": 0.48843890577554705, + "epoch": 2.488169364881694, + "grad_norm": 0.9082473516464233, + "learning_rate": 0.00021141500186075868, + "loss": 0.4309722423553467, + "mean_token_accuracy": 0.8686766296625137, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5543508351195691, + "eval_loss": 0.5478800535202026, + "eval_mean_token_accuracy": 0.8478029522784921, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.3835, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 1000 + }, + { + "entropy": 0.4777219031006098, + "epoch": 2.5379825653798256, + "grad_norm": 0.7448089122772217, + "learning_rate": 0.0002104266917731438, + "loss": 0.423325252532959, + "mean_token_accuracy": 0.8706337086856365, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.49857561550168106, + "eval_loss": 0.5511948466300964, + "eval_mean_token_accuracy": 0.8502220289651737, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.5399, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.988, + "step": 1020 + }, + { + "entropy": 0.4844174191355705, + "epoch": 2.587795765877958, + "grad_norm": 0.794029176235199, + "learning_rate": 0.00020940904126432, + "loss": 0.4176753044128418, + "mean_token_accuracy": 0.873535567522049, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.485467542222766, + "eval_loss": 0.5539286732673645, + "eval_mean_token_accuracy": 0.8495475081510322, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.135, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 1.997, + "step": 1040 + }, + { + "entropy": 0.49070929251611234, + "epoch": 2.6376089663760895, + "grad_norm": 0.7558256983757019, + "learning_rate": 0.0002083623572438007, + "loss": 0.42867293357849123, + "mean_token_accuracy": 0.8696666076779366, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.490822730889154, + "eval_loss": 0.5434785485267639, + "eval_mean_token_accuracy": 0.850568296950917, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.4933, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 1060 + }, + { + "entropy": 0.47806114703416824, + "epoch": 2.6874221668742218, + "grad_norm": 0.6608979105949402, + "learning_rate": 0.00020728695537721047, + "loss": 0.4289727687835693, + "mean_token_accuracy": 0.8693130135536193, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.5285773256490397, + "eval_loss": 0.5444230437278748, + "eval_mean_token_accuracy": 0.8498796481032704, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.7091, + "eval_samples_per_second": 15.858, + "eval_steps_per_second": 1.984, + "step": 1080 + }, + { + "entropy": 0.5046216730028391, + "epoch": 2.7372353673723535, + "grad_norm": 0.8428544998168945, + "learning_rate": 0.00020618315999108454, + "loss": 0.43131070137023925, + "mean_token_accuracy": 0.8701941035687923, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.49888394738352576, + "eval_loss": 0.5459766387939453, + "eval_mean_token_accuracy": 0.8511758872935938, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.2222, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.995, + "step": 1100 + }, + { + "entropy": 0.5212558470666409, + "epoch": 2.7870485678704857, + "grad_norm": 1.129318118095398, + "learning_rate": 0.00020505130397505635, + "loss": 0.44249300956726073, + "mean_token_accuracy": 0.8654101334512234, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5179622324053631, + "eval_loss": 0.5522801280021667, + "eval_mean_token_accuracy": 0.8497019947268242, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.1903, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.996, + "step": 1120 + }, + { + "entropy": 0.4988406613469124, + "epoch": 2.8368617683686175, + "grad_norm": 0.6460545063018799, + "learning_rate": 0.00020389172868146263, + "loss": 0.4386270523071289, + "mean_token_accuracy": 0.8690383620560169, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.5042278484203094, + "eval_loss": 0.5433034300804138, + "eval_mean_token_accuracy": 0.8497674451317898, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.3028, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.993, + "step": 1140 + }, + { + "entropy": 0.4926559619605541, + "epoch": 2.8866749688667497, + "grad_norm": 0.8199329972267151, + "learning_rate": 0.00020270478382239615, + "loss": 0.4313485145568848, + "mean_token_accuracy": 0.8674727231264114, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.503873193160046, + "eval_loss": 0.5388111472129822, + "eval_mean_token_accuracy": 0.8526195034731266, + "eval_num_tokens": 2710196.0, + "eval_runtime": 86.4054, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.991, + "step": 1160 + }, + { + "entropy": 0.5020013231784105, + "epoch": 2.936488169364882, + "grad_norm": 0.7344821095466614, + "learning_rate": 0.00020149082736423723, + "loss": 0.43590536117553713, + "mean_token_accuracy": 0.8671772189438343, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5368241809828337, + "eval_loss": 0.5355703830718994, + "eval_mean_token_accuracy": 0.8517617773871089, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.2945, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1180 + }, + { + "entropy": 0.5112275708466768, + "epoch": 2.9863013698630136, + "grad_norm": 0.6951606869697571, + "learning_rate": 0.00020025022541969622, + "loss": 0.43579301834106443, + "mean_token_accuracy": 0.8641206480562686, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.5066795706055885, + "eval_loss": 0.5415249466896057, + "eval_mean_token_accuracy": 0.8493563373421513, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.5005, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.988, + "step": 1200 + }, + { + "entropy": 0.42298635305502474, + "epoch": 3.0348692403486925, + "grad_norm": 0.8201794028282166, + "learning_rate": 0.00019898335213739863, + "loss": 0.35593905448913576, + "mean_token_accuracy": 0.889238600547497, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.4584170470750609, + "eval_loss": 0.569487452507019, + "eval_mean_token_accuracy": 0.8495814173027526, + "eval_num_tokens": 2848509.0, + "eval_runtime": 86.2281, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 1220 + }, + { + "entropy": 0.37450140453875064, + "epoch": 3.0846824408468243, + "grad_norm": 0.7308394908905029, + "learning_rate": 0.0001976905895890471, + "loss": 0.307823920249939, + "mean_token_accuracy": 0.9001288741827012, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.45185995916294497, + "eval_loss": 0.5672881603240967, + "eval_mean_token_accuracy": 0.8511318519364955, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.0819, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.998, + "step": 1240 + }, + { + "entropy": 0.3887945845723152, + "epoch": 3.1344956413449565, + "grad_norm": 0.7299330830574036, + "learning_rate": 0.0001963723276541939, + "loss": 0.32047903537750244, + "mean_token_accuracy": 0.8960984498262405, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.44865354549053105, + "eval_loss": 0.5666037201881409, + "eval_mean_token_accuracy": 0.8496572649063066, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 1260 + }, + { + "entropy": 0.39677664265036583, + "epoch": 3.1843088418430883, + "grad_norm": 0.9533219933509827, + "learning_rate": 0.00019502896390265838, + "loss": 0.3253983497619629, + "mean_token_accuracy": 0.8964207418262958, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.4641980809527774, + "eval_loss": 0.5814996957778931, + "eval_mean_token_accuracy": 0.8485886212005171, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.7784, + "eval_samples_per_second": 15.845, + "eval_steps_per_second": 1.982, + "step": 1280 + }, + { + "entropy": 0.39210722744464876, + "epoch": 3.2341220423412205, + "grad_norm": 0.7447651028633118, + "learning_rate": 0.00019366090347462545, + "loss": 0.3276803970336914, + "mean_token_accuracy": 0.8930055953562259, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43595615254585135, + "eval_loss": 0.5722188353538513, + "eval_mean_token_accuracy": 0.8501105755567551, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.5271, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 1300 + }, + { + "entropy": 0.3684127271175385, + "epoch": 3.2839352428393527, + "grad_norm": 0.6934201121330261, + "learning_rate": 0.00019226855895846078, + "loss": 0.3156379222869873, + "mean_token_accuracy": 0.8976306475698947, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.4628148723480313, + "eval_loss": 0.5631352066993713, + "eval_mean_token_accuracy": 0.8504934813394103, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.3436, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 1320 + }, + { + "entropy": 0.4073401909321547, + "epoch": 3.3337484433374844, + "grad_norm": 0.9386897683143616, + "learning_rate": 0.00019085235026627994, + "loss": 0.34265310764312745, + "mean_token_accuracy": 0.8902062118053437, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.46455050623694133, + "eval_loss": 0.5586736798286438, + "eval_mean_token_accuracy": 0.8506874702004499, + "eval_num_tokens": 3132874.0, + "eval_runtime": 86.1286, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.997, + "step": 1340 + }, + { + "entropy": 0.4046429242938757, + "epoch": 3.383561643835616, + "grad_norm": 0.9633992314338684, + "learning_rate": 0.00018941270450730836, + "loss": 0.33816893100738527, + "mean_token_accuracy": 0.8927541889250279, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.46846531660750856, + "eval_loss": 0.561501681804657, + "eval_mean_token_accuracy": 0.8496256377114806, + "eval_num_tokens": 3178055.0, + "eval_runtime": 86.685, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1360 + }, + { + "entropy": 0.39872407019138334, + "epoch": 3.4333748443337484, + "grad_norm": 0.7786458730697632, + "learning_rate": 0.00018795005585907113, + "loss": 0.33342490196228025, + "mean_token_accuracy": 0.8944805048406124, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.42709505973860273, + "eval_loss": 0.5751848220825195, + "eval_mean_token_accuracy": 0.8507290447867194, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.6892, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 1380 + }, + { + "entropy": 0.3923338124528527, + "epoch": 3.4831880448318806, + "grad_norm": 0.9305956363677979, + "learning_rate": 0.0001864648454364511, + "loss": 0.33188116550445557, + "mean_token_accuracy": 0.8943330392241478, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.4386174779298694, + "eval_loss": 0.5680831074714661, + "eval_mean_token_accuracy": 0.8513129727784977, + "eval_num_tokens": 3274096.0, + "eval_runtime": 86.2671, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 1400 + }, + { + "entropy": 0.3856233984231949, + "epoch": 3.5330012453300124, + "grad_norm": 1.0362752676010132, + "learning_rate": 0.0001849575211586545, + "loss": 0.33098697662353516, + "mean_token_accuracy": 0.8961390435695649, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4574795474493226, + "eval_loss": 0.5630439519882202, + "eval_mean_token_accuracy": 0.8520988873964133, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.6035, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 1420 + }, + { + "entropy": 0.39812871962785723, + "epoch": 3.5828144458281446, + "grad_norm": 0.7807195782661438, + "learning_rate": 0.0001834285376141247, + "loss": 0.3333771228790283, + "mean_token_accuracy": 0.8930827379226685, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.4556825893909432, + "eval_loss": 0.5689062476158142, + "eval_mean_token_accuracy": 0.8507103507601937, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.1606, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.996, + "step": 1440 + }, + { + "entropy": 0.4147744856774807, + "epoch": 3.6326276463262763, + "grad_norm": 0.6429352164268494, + "learning_rate": 0.00018187835592344443, + "loss": 0.3482560873031616, + "mean_token_accuracy": 0.8910200245678425, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.46600024540757023, + "eval_loss": 0.5609709024429321, + "eval_mean_token_accuracy": 0.8491220876227977, + "eval_num_tokens": 3415600.0, + "eval_runtime": 86.8039, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1460 + }, + { + "entropy": 0.40425071083009245, + "epoch": 3.6824408468244085, + "grad_norm": 0.8613698482513428, + "learning_rate": 0.0001803074436002682, + "loss": 0.342916464805603, + "mean_token_accuracy": 0.8916418336331844, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.43855057899342026, + "eval_loss": 0.5720968246459961, + "eval_mean_token_accuracy": 0.8500823641932288, + "eval_num_tokens": 3460471.0, + "eval_runtime": 86.6746, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1480 + }, + { + "entropy": 0.39465143866837027, + "epoch": 3.7322540473225407, + "grad_norm": 0.6285189986228943, + "learning_rate": 0.0001787162744103265, + "loss": 0.3424591779708862, + "mean_token_accuracy": 0.8906558901071548, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4509461877304454, + "eval_loss": 0.5590082406997681, + "eval_mean_token_accuracy": 0.8511747371318729, + "eval_num_tokens": 3507647.0, + "eval_runtime": 86.8126, + "eval_samples_per_second": 15.839, + "eval_steps_per_second": 1.981, + "step": 1500 + }, + { + "entropy": 0.4021005939692259, + "epoch": 3.7820672478206725, + "grad_norm": 0.8821248412132263, + "learning_rate": 0.00017710532822854468, + "loss": 0.3462103843688965, + "mean_token_accuracy": 0.889109355956316, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.4502199075596277, + "eval_loss": 0.566046416759491, + "eval_mean_token_accuracy": 0.8501714208098345, + "eval_num_tokens": 3548934.0, + "eval_runtime": 86.8336, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.981, + "step": 1520 + }, + { + "entropy": 0.4017397932708263, + "epoch": 3.8318804483188043, + "grad_norm": 0.8400952816009521, + "learning_rate": 0.0001754750908943189, + "loss": 0.34890995025634763, + "mean_token_accuracy": 0.8892098367214203, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.4614003023435903, + "eval_loss": 0.5617933869361877, + "eval_mean_token_accuracy": 0.8515863616106122, + "eval_num_tokens": 3597186.0, + "eval_runtime": 86.4609, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 1540 + }, + { + "entropy": 0.4112051840871572, + "epoch": 3.8816936488169365, + "grad_norm": 0.769478440284729, + "learning_rate": 0.0001738260540649939, + "loss": 0.34711437225341796, + "mean_token_accuracy": 0.8911717928946018, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4540443811998811, + "eval_loss": 0.5576469898223877, + "eval_mean_token_accuracy": 0.8512079674144124, + "eval_num_tokens": 3646646.0, + "eval_runtime": 86.5103, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 1560 + }, + { + "entropy": 0.41105241514742374, + "epoch": 3.9315068493150687, + "grad_norm": 0.8468427062034607, + "learning_rate": 0.00017215871506758568, + "loss": 0.3433023452758789, + "mean_token_accuracy": 0.8898739732801915, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.4707539707075718, + "eval_loss": 0.5641466379165649, + "eval_mean_token_accuracy": 0.8495440957851188, + "eval_num_tokens": 3689560.0, + "eval_runtime": 86.609, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.986, + "step": 1580 + }, + { + "entropy": 0.41016379147768023, + "epoch": 3.9813200498132004, + "grad_norm": 0.7482675313949585, + "learning_rate": 0.0001704735767487946, + "loss": 0.34550890922546384, + "mean_token_accuracy": 0.8893028847873211, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.46391099864660307, + "eval_loss": 0.5593640804290771, + "eval_mean_token_accuracy": 0.8510130581467651, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.3975, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 1600 + }, + { + "entropy": 0.33167599791135544, + "epoch": 4.029887920298879, + "grad_norm": 0.9435692429542542, + "learning_rate": 0.00016877114732335337, + "loss": 0.2716026544570923, + "mean_token_accuracy": 0.9133149828666296, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.38499350005457567, + "eval_loss": 0.6298249363899231, + "eval_mean_token_accuracy": 0.8488117071778275, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.2933, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1620 + }, + { + "entropy": 0.3000166634097695, + "epoch": 4.0797011207970115, + "grad_norm": 0.8080845475196838, + "learning_rate": 0.0001670519402207569, + "loss": 0.22617182731628419, + "mean_token_accuracy": 0.9253474645316601, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.370110988703578, + "eval_loss": 0.6338461637496948, + "eval_mean_token_accuracy": 0.8485634801692741, + "eval_num_tokens": 3828830.0, + "eval_runtime": 85.9508, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.001, + "step": 1640 + }, + { + "entropy": 0.2986910421401262, + "epoch": 4.129514321295143, + "grad_norm": 0.7310900092124939, + "learning_rate": 0.0001653164739304185, + "loss": 0.22367463111877442, + "mean_token_accuracy": 0.9252275295555592, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.3944379702037157, + "eval_loss": 0.6109381914138794, + "eval_mean_token_accuracy": 0.849291454220927, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.6728, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1660 + }, + { + "entropy": 0.3095553796738386, + "epoch": 4.179327521793275, + "grad_norm": 0.7059140801429749, + "learning_rate": 0.0001635652718453007, + "loss": 0.23651680946350098, + "mean_token_accuracy": 0.9208931416273117, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.3910588648949945, + "eval_loss": 0.6104469299316406, + "eval_mean_token_accuracy": 0.8486883893262508, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7612, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.982, + "step": 1680 + }, + { + "entropy": 0.3001101028174162, + "epoch": 4.229140722291407, + "grad_norm": 0.6787802577018738, + "learning_rate": 0.00016179886210406728, + "loss": 0.23130471706390382, + "mean_token_accuracy": 0.9233332790434361, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3794369170832079, + "eval_loss": 0.6182110905647278, + "eval_mean_token_accuracy": 0.8495433777570724, + "eval_num_tokens": 3967474.0, + "eval_runtime": 85.94, + "eval_samples_per_second": 16.0, + "eval_steps_per_second": 2.001, + "step": 1700 + }, + { + "entropy": 0.3031421799212694, + "epoch": 4.2789539227895395, + "grad_norm": 0.9732038378715515, + "learning_rate": 0.0001600177774318036, + "loss": 0.2359529733657837, + "mean_token_accuracy": 0.9217648565769195, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3923123094231583, + "eval_loss": 0.6057384610176086, + "eval_mean_token_accuracy": 0.8508818288182103, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7647, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.29365369994193313, + "epoch": 4.328767123287671, + "grad_norm": 0.7681498527526855, + "learning_rate": 0.0001582225549793541, + "loss": 0.2269371747970581, + "mean_token_accuracy": 0.9245341829955578, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.4011661055129628, + "eval_loss": 0.6144486665725708, + "eval_mean_token_accuracy": 0.8480324357054955, + "eval_num_tokens": 4062594.0, + "eval_runtime": 87.1306, + "eval_samples_per_second": 15.781, + "eval_steps_per_second": 1.974, + "step": 1740 + }, + { + "entropy": 0.29396994728595016, + "epoch": 4.378580323785803, + "grad_norm": 1.0001007318496704, + "learning_rate": 0.0001564137361613248, + "loss": 0.22777395248413085, + "mean_token_accuracy": 0.9262309700250626, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38518730195802314, + "eval_loss": 0.6202630400657654, + "eval_mean_token_accuracy": 0.8493869807137999, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6616, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.3096018506214023, + "epoch": 4.428393524283935, + "grad_norm": 1.0448365211486816, + "learning_rate": 0.00015459186649280024, + "loss": 0.23696351051330566, + "mean_token_accuracy": 0.9217322513461113, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.3946371126140273, + "eval_loss": 0.6079026460647583, + "eval_mean_token_accuracy": 0.8492515852978063, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6582, + "eval_samples_per_second": 15.867, + "eval_steps_per_second": 1.985, + "step": 1780 + }, + { + "entropy": 0.32619857545942066, + "epoch": 4.478206724782067, + "grad_norm": 0.7210651636123657, + "learning_rate": 0.00015275749542482337, + "loss": 0.24651215076446534, + "mean_token_accuracy": 0.9177676141262054, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.3947690814560236, + "eval_loss": 0.6065912246704102, + "eval_mean_token_accuracy": 0.8502957744653835, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.5959, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.986, + "step": 1800 + }, + { + "entropy": 0.3193941755220294, + "epoch": 4.5280199252802, + "grad_norm": 0.8281906843185425, + "learning_rate": 0.0001509111761786888, + "loss": 0.23936262130737304, + "mean_token_accuracy": 0.9201708927750587, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38704028864239537, + "eval_loss": 0.6006569266319275, + "eval_mean_token_accuracy": 0.8502406720505205, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.8059, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1820 + }, + { + "entropy": 0.3164879363030195, + "epoch": 4.577833125778331, + "grad_norm": 0.7892968654632568, + "learning_rate": 0.00014905346557909867, + "loss": 0.24541733264923096, + "mean_token_accuracy": 0.9175932116806507, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.38861122120951497, + "eval_loss": 0.6115967631340027, + "eval_mean_token_accuracy": 0.849471275196519, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.2946, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1840 + }, + { + "entropy": 0.3051785985007882, + "epoch": 4.627646326276463, + "grad_norm": 0.8109654188156128, + "learning_rate": 0.0001471849238862319, + "loss": 0.23433220386505127, + "mean_token_accuracy": 0.9206570319831371, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.37162452295076015, + "eval_loss": 0.6184061765670776, + "eval_mean_token_accuracy": 0.8501173268223918, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.6865, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1860 + }, + { + "entropy": 0.3168198253959417, + "epoch": 4.677459526774595, + "grad_norm": 0.9512342214584351, + "learning_rate": 0.0001453061146267775, + "loss": 0.23832404613494873, + "mean_token_accuracy": 0.9197044663131237, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3845940856912801, + "eval_loss": 0.606762707233429, + "eval_mean_token_accuracy": 0.8504838194957999, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.5175, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 1880 + }, + { + "entropy": 0.30791807882487776, + "epoch": 4.7272727272727275, + "grad_norm": 0.8123113512992859, + "learning_rate": 0.00014341760442398248, + "loss": 0.2395785331726074, + "mean_token_accuracy": 0.918928150832653, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.39762327222283494, + "eval_loss": 0.5994202494621277, + "eval_mean_token_accuracy": 0.8509274201337681, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.2873, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.993, + "step": 1900 + }, + { + "entropy": 0.3021434534341097, + "epoch": 4.777085927770859, + "grad_norm": 0.731787383556366, + "learning_rate": 0.000141519962826766, + "loss": 0.23494718074798585, + "mean_token_accuracy": 0.9201403826475143, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.3827026732439219, + "eval_loss": 0.5995895862579346, + "eval_mean_token_accuracy": 0.851468373523202, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.3006, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 1920 + }, + { + "entropy": 0.31626159623265265, + "epoch": 4.826899128268991, + "grad_norm": 0.8848487138748169, + "learning_rate": 0.00013961376213795132, + "loss": 0.2439030647277832, + "mean_token_accuracy": 0.9196575872600079, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.388698436839636, + "eval_loss": 0.6000174283981323, + "eval_mean_token_accuracy": 0.8518068187458571, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.8979, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.979, + "step": 1940 + }, + { + "entropy": 0.30520407035946845, + "epoch": 4.876712328767123, + "grad_norm": 0.8532460927963257, + "learning_rate": 0.00013769957724166695, + "loss": 0.23458616733551024, + "mean_token_accuracy": 0.9221912942826748, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.38777847102908203, + "eval_loss": 0.6004981398582458, + "eval_mean_token_accuracy": 0.8516481768253238, + "eval_num_tokens": 4578167.0, + "eval_runtime": 87.0777, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.975, + "step": 1960 + }, + { + "entropy": 0.3226448342204094, + "epoch": 4.926525529265255, + "grad_norm": 0.6945561766624451, + "learning_rate": 0.0001357779854299694, + "loss": 0.24048397541046143, + "mean_token_accuracy": 0.9195300146937371, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.38581624263247777, + "eval_loss": 0.6029234528541565, + "eval_mean_token_accuracy": 0.8514213260523108, + "eval_num_tokens": 4622316.0, + "eval_runtime": 85.8729, + "eval_samples_per_second": 16.012, + "eval_steps_per_second": 2.003, + "step": 1980 + }, + { + "entropy": 0.3051655298098922, + "epoch": 4.976338729763388, + "grad_norm": 0.7976452708244324, + "learning_rate": 0.00013384956622874001, + "loss": 0.23584742546081544, + "mean_token_accuracy": 0.9216851457953453, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.37913159246361533, + "eval_loss": 0.6057604551315308, + "eval_mean_token_accuracy": 0.8525801203971686, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.1145, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 2000 + }, + { + "entropy": 0.27438195240803254, + "epoch": 5.024906600249066, + "grad_norm": 0.6729586124420166, + "learning_rate": 0.0001319149012229075, + "loss": 0.19775952100753785, + "mean_token_accuracy": 0.9339428559327737, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.3448961910813354, + "eval_loss": 0.6750120520591736, + "eval_mean_token_accuracy": 0.8487970232963562, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.1169, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 2020 + }, + { + "entropy": 0.21423916313797237, + "epoch": 5.074719800747198, + "grad_norm": 0.6934391856193542, + "learning_rate": 0.00012997457388105022, + "loss": 0.1439570426940918, + "mean_token_accuracy": 0.9528236843645572, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.3570949243771475, + "eval_loss": 0.6465504169464111, + "eval_mean_token_accuracy": 0.8490785547467166, + "eval_num_tokens": 4763269.0, + "eval_runtime": 85.9574, + "eval_samples_per_second": 15.996, + "eval_steps_per_second": 2.001, + "step": 2040 + }, + { + "entropy": 0.20838565267622472, + "epoch": 5.12453300124533, + "grad_norm": 0.7286986112594604, + "learning_rate": 0.00012802916937942972, + "loss": 0.14467307329177856, + "mean_token_accuracy": 0.950994835793972, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.3452463157821533, + "eval_loss": 0.6705958843231201, + "eval_mean_token_accuracy": 0.8490352796953778, + "eval_num_tokens": 4809047.0, + "eval_runtime": 86.228, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 2060 + }, + { + "entropy": 0.20453082229942082, + "epoch": 5.174346201743462, + "grad_norm": 0.7515555620193481, + "learning_rate": 0.00012607927442550974, + "loss": 0.13732000589370727, + "mean_token_accuracy": 0.9537357829511166, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.32431264914745506, + "eval_loss": 0.6743043065071106, + "eval_mean_token_accuracy": 0.8504878629085629, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.5948, + "eval_samples_per_second": 15.879, + "eval_steps_per_second": 1.986, + "step": 2080 + }, + { + "entropy": 0.21812320686876774, + "epoch": 5.224159402241594, + "grad_norm": 0.9093465209007263, + "learning_rate": 0.0001241254770810132, + "loss": 0.14311420917510986, + "mean_token_accuracy": 0.9514068141579628, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.33086285835435225, + "eval_loss": 0.6676449179649353, + "eval_mean_token_accuracy": 0.8505287662495015, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 2100 + }, + { + "entropy": 0.2180163251236081, + "epoch": 5.273972602739726, + "grad_norm": 0.6703007221221924, + "learning_rate": 0.00012216836658457075, + "loss": 0.14803968667984008, + "mean_token_accuracy": 0.9521303348243236, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.33162341708707255, + "eval_loss": 0.6658875942230225, + "eval_mean_token_accuracy": 0.8500757605530495, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.6296, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 2120 + }, + { + "entropy": 0.22511130161583423, + "epoch": 5.323785803237858, + "grad_norm": 0.8078880906105042, + "learning_rate": 0.00012020853317401455, + "loss": 0.15228408575057983, + "mean_token_accuracy": 0.947144789993763, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3354601170434508, + "eval_loss": 0.6677829623222351, + "eval_mean_token_accuracy": 0.8482600024273229, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.4689, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.989, + "step": 2140 + }, + { + "entropy": 0.2244176059961319, + "epoch": 5.37359900373599, + "grad_norm": 0.9636075496673584, + "learning_rate": 0.00011824656790837037, + "loss": 0.15260883569717407, + "mean_token_accuracy": 0.9471467643976211, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.3381616926297199, + "eval_loss": 0.6694412231445312, + "eval_mean_token_accuracy": 0.8482369603805764, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.4147, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 2160 + }, + { + "entropy": 0.22982364390045404, + "epoch": 5.423412204234122, + "grad_norm": 0.775401771068573, + "learning_rate": 0.00011628306248960262, + "loss": 0.15140302181243898, + "mean_token_accuracy": 0.9492553934454918, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.3305150235808173, + "eval_loss": 0.6717822551727295, + "eval_mean_token_accuracy": 0.8489849723355715, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.4728, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.989, + "step": 2180 + }, + { + "entropy": 0.21448935717344284, + "epoch": 5.473225404732254, + "grad_norm": 0.6575281023979187, + "learning_rate": 0.00011431860908416465, + "loss": 0.1452319622039795, + "mean_token_accuracy": 0.9505287684500218, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3488145174328671, + "eval_loss": 0.6612305641174316, + "eval_mean_token_accuracy": 0.8492907808963642, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6927, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 2200 + }, + { + "entropy": 0.23091202937066554, + "epoch": 5.523038605230386, + "grad_norm": 0.8909686207771301, + "learning_rate": 0.00011235380014440985, + "loss": 0.15150139331817628, + "mean_token_accuracy": 0.9497875183820724, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.3268539015810157, + "eval_loss": 0.6667542457580566, + "eval_mean_token_accuracy": 0.8499062903398691, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.4644, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 2220 + }, + { + "entropy": 0.2227974807843566, + "epoch": 5.572851805728518, + "grad_norm": 0.6180275082588196, + "learning_rate": 0.0001103892282299158, + "loss": 0.1491069197654724, + "mean_token_accuracy": 0.9488144010305405, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3346347655494546, + "eval_loss": 0.6665948629379272, + "eval_mean_token_accuracy": 0.8499961893918903, + "eval_num_tokens": 5226864.0, + "eval_runtime": 87.0548, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.976, + "step": 2240 + }, + { + "entropy": 0.21368421968072654, + "epoch": 5.62266500622665, + "grad_norm": 0.6004369258880615, + "learning_rate": 0.00010842548582877651, + "loss": 0.14485255479812623, + "mean_token_accuracy": 0.9502056457102299, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.32753298804163933, + "eval_loss": 0.6680151224136353, + "eval_mean_token_accuracy": 0.8515451086121936, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.8524, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.98, + "step": 2260 + }, + { + "entropy": 0.2103635374456644, + "epoch": 5.672478206724782, + "grad_norm": 0.699174702167511, + "learning_rate": 0.00010646316517891613, + "loss": 0.14297772645950318, + "mean_token_accuracy": 0.9512537539005279, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.32966585959806, + "eval_loss": 0.675578773021698, + "eval_mean_token_accuracy": 0.8509623023659684, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.4518, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.99, + "step": 2280 + }, + { + "entropy": 0.22516900151968003, + "epoch": 5.722291407222914, + "grad_norm": 0.6637354493141174, + "learning_rate": 0.00010450285808947797, + "loss": 0.15202572345733642, + "mean_token_accuracy": 0.9482452072203159, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3369456917740578, + "eval_loss": 0.6697061061859131, + "eval_mean_token_accuracy": 0.848603522361711, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.6371, + "eval_samples_per_second": 15.871, + "eval_steps_per_second": 1.985, + "step": 2300 + }, + { + "entropy": 0.21841065725311637, + "epoch": 5.772104607721046, + "grad_norm": 0.7940268516540527, + "learning_rate": 0.00010254515576234297, + "loss": 0.14710167646408082, + "mean_token_accuracy": 0.9493498183786869, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3237486180177955, + "eval_loss": 0.6779657602310181, + "eval_mean_token_accuracy": 0.8500715313955794, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.1826, + "eval_samples_per_second": 15.954, + "eval_steps_per_second": 1.996, + "step": 2320 + }, + { + "entropy": 0.22146204356104135, + "epoch": 5.821917808219178, + "grad_norm": 0.9234833121299744, + "learning_rate": 0.00010059064861383132, + "loss": 0.14720046520233154, + "mean_token_accuracy": 0.9493872679769992, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.32365207564692167, + "eval_loss": 0.6704005002975464, + "eval_mean_token_accuracy": 0.8507985760306203, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.5494, + "eval_samples_per_second": 15.887, + "eval_steps_per_second": 1.987, + "step": 2340 + }, + { + "entropy": 0.20934011954814197, + "epoch": 5.87173100871731, + "grad_norm": 0.5547503232955933, + "learning_rate": 9.863992609664084e-05, + "loss": 0.1464867353439331, + "mean_token_accuracy": 0.9503875687718392, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.3330401429083458, + "eval_loss": 0.6659091114997864, + "eval_mean_token_accuracy": 0.8504848906467127, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.5855, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 2360 + }, + { + "entropy": 0.21678635366261007, + "epoch": 5.921544209215442, + "grad_norm": 0.570612907409668, + "learning_rate": 9.669357652207635e-05, + "loss": 0.14821385145187377, + "mean_token_accuracy": 0.9503940217196941, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3322022325077722, + "eval_loss": 0.6722489595413208, + "eval_mean_token_accuracy": 0.8489979422369669, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.2986, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 2380 + }, + { + "entropy": 0.20932920072227718, + "epoch": 5.971357409713574, + "grad_norm": 0.7879557609558105, + "learning_rate": 9.475218688262262e-05, + "loss": 0.14675841331481934, + "mean_token_accuracy": 0.9507176131010056, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.3199348642902319, + "eval_loss": 0.6698136329650879, + "eval_mean_token_accuracy": 0.8514142130003419, + "eval_num_tokens": 5605400.0, + "eval_runtime": 85.8995, + "eval_samples_per_second": 16.007, + "eval_steps_per_second": 2.002, + "step": 2400 + }, + { + "entropy": 0.21032143919131693, + "epoch": 6.019925280199253, + "grad_norm": 0.5823076367378235, + "learning_rate": 9.281634267491569e-05, + "loss": 0.13322267532348633, + "mean_token_accuracy": 0.9550939072401096, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.30206270117399303, + "eval_loss": 0.7093168497085571, + "eval_mean_token_accuracy": 0.8500627639681794, + "eval_num_tokens": 5648968.0, + "eval_runtime": 85.8128, + "eval_samples_per_second": 16.023, + "eval_steps_per_second": 2.004, + "step": 2420 + }, + { + "entropy": 0.1534628233872354, + "epoch": 6.069738480697385, + "grad_norm": 0.710133969783783, + "learning_rate": 9.088662772316508e-05, + "loss": 0.09078952670097351, + "mean_token_accuracy": 0.9678447999060154, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.28208133101809857, + "eval_loss": 0.7636417150497437, + "eval_mean_token_accuracy": 0.8494061477655588, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9724, + "eval_samples_per_second": 15.994, + "eval_steps_per_second": 2.001, + "step": 2440 + }, + { + "entropy": 0.16151462448760867, + "epoch": 6.119551681195516, + "grad_norm": 0.5793812274932861, + "learning_rate": 8.896362400308028e-05, + "loss": 0.09545697569847107, + "mean_token_accuracy": 0.9671573750674725, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.2833245605403601, + "eval_loss": 0.7402405738830566, + "eval_mean_token_accuracy": 0.8503523728875226, + "eval_num_tokens": 5745090.0, + "eval_runtime": 85.5461, + "eval_samples_per_second": 16.073, + "eval_steps_per_second": 2.011, + "step": 2460 + }, + { + "entropy": 0.15203177919611335, + "epoch": 6.169364881693649, + "grad_norm": 0.4251123368740082, + "learning_rate": 8.704791146635483e-05, + "loss": 0.09420782327651978, + "mean_token_accuracy": 0.9677386932075024, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.28572545962971313, + "eval_loss": 0.735416829586029, + "eval_mean_token_accuracy": 0.8487084663884584, + "eval_num_tokens": 5790333.0, + "eval_runtime": 85.4801, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.012, + "step": 2480 + }, + { + "entropy": 0.15587336672469973, + "epoch": 6.219178082191781, + "grad_norm": 0.4357028007507324, + "learning_rate": 8.514006786576085e-05, + "loss": 0.09429320096969604, + "mean_token_accuracy": 0.9682952925562859, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.2859006894882335, + "eval_loss": 0.7347224950790405, + "eval_mean_token_accuracy": 0.8501905518215757, + "eval_num_tokens": 5837321.0, + "eval_runtime": 85.7578, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.006, + "step": 2500 + }, + { + "entropy": 0.15765639198943973, + "epoch": 6.268991282689913, + "grad_norm": 0.47331130504608154, + "learning_rate": 8.324066858090663e-05, + "loss": 0.09571113586425781, + "mean_token_accuracy": 0.9683481335639954, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.29231513846059176, + "eval_loss": 0.7392512559890747, + "eval_mean_token_accuracy": 0.8486633983462356, + "eval_num_tokens": 5884398.0, + "eval_runtime": 85.7846, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.005, + "step": 2520 + }, + { + "entropy": 0.16176860257983208, + "epoch": 6.318804483188045, + "grad_norm": 0.6142018437385559, + "learning_rate": 8.135028644470992e-05, + "loss": 0.09486144185066223, + "mean_token_accuracy": 0.9682316601276397, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.2851274753379267, + "eval_loss": 0.7520816922187805, + "eval_mean_token_accuracy": 0.8501113649717597, + "eval_num_tokens": 5929876.0, + "eval_runtime": 85.9425, + "eval_samples_per_second": 15.999, + "eval_steps_per_second": 2.001, + "step": 2540 + }, + { + "entropy": 0.15404034564271568, + "epoch": 6.3686176836861765, + "grad_norm": 0.6051287651062012, + "learning_rate": 7.946949157063964e-05, + "loss": 0.09280472993850708, + "mean_token_accuracy": 0.9684635892510414, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28802703563557114, + "eval_loss": 0.7439162135124207, + "eval_mean_token_accuracy": 0.8499851770872293, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.0703, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.998, + "step": 2560 + }, + { + "entropy": 0.15343588953837753, + "epoch": 6.418430884184309, + "grad_norm": 0.4823743402957916, + "learning_rate": 7.759885118077701e-05, + "loss": 0.09000591039657593, + "mean_token_accuracy": 0.9699928767979145, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2795634938533916, + "eval_loss": 0.7647850513458252, + "eval_mean_token_accuracy": 0.8503464397995971, + "eval_num_tokens": 6025380.0, + "eval_runtime": 85.8886, + "eval_samples_per_second": 16.009, + "eval_steps_per_second": 2.003, + "step": 2580 + }, + { + "entropy": 0.15740026142448188, + "epoch": 6.468244084682441, + "grad_norm": 0.5082696676254272, + "learning_rate": 7.57389294347494e-05, + "loss": 0.09191849827766418, + "mean_token_accuracy": 0.9692809768021107, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2913342311458532, + "eval_loss": 0.7518694996833801, + "eval_mean_token_accuracy": 0.8483168302580367, + "eval_num_tokens": 6073349.0, + "eval_runtime": 85.5761, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.01, + "step": 2600 + }, + { + "entropy": 0.15922069251537324, + "epoch": 6.518057285180573, + "grad_norm": 0.3995199501514435, + "learning_rate": 7.389028725958736e-05, + "loss": 0.09584367871284485, + "mean_token_accuracy": 0.9685114495456218, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.2863075934177221, + "eval_loss": 0.7539381384849548, + "eval_mean_token_accuracy": 0.8507507083027862, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.112, + "eval_samples_per_second": 15.968, + "eval_steps_per_second": 1.997, + "step": 2620 + }, + { + "entropy": 0.16197575423866512, + "epoch": 6.567870485678705, + "grad_norm": 0.534295380115509, + "learning_rate": 7.205348218055678e-05, + "loss": 0.0961170256137848, + "mean_token_accuracy": 0.9674530044198036, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.29021967315050057, + "eval_loss": 0.751198947429657, + "eval_mean_token_accuracy": 0.8509796344956686, + "eval_num_tokens": 6165523.0, + "eval_runtime": 85.7958, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.005, + "step": 2640 + }, + { + "entropy": 0.15261746793985367, + "epoch": 6.617683686176837, + "grad_norm": 0.5391237139701843, + "learning_rate": 7.022906815301673e-05, + "loss": 0.0926026999950409, + "mean_token_accuracy": 0.9695659473538398, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.29128045216202736, + "eval_loss": 0.7450292110443115, + "eval_mean_token_accuracy": 0.8498771443616512, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.3963, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 2660 + }, + { + "entropy": 0.16164180357009172, + "epoch": 6.667496886674969, + "grad_norm": 0.5767946243286133, + "learning_rate": 6.841759539535419e-05, + "loss": 0.09291981458663941, + "mean_token_accuracy": 0.9687136687338352, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2897637223088464, + "eval_loss": 0.7503410577774048, + "eval_mean_token_accuracy": 0.8503315164599308, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.0653, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.998, + "step": 2680 + }, + { + "entropy": 0.17062523355707526, + "epoch": 6.717310087173101, + "grad_norm": 0.4974168539047241, + "learning_rate": 6.661961022304563e-05, + "loss": 0.09713236689567566, + "mean_token_accuracy": 0.9661971725523472, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2765843396963075, + "eval_loss": 0.7604002356529236, + "eval_mean_token_accuracy": 0.8521115277395692, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.1676, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 2700 + }, + { + "entropy": 0.17544092936441302, + "epoch": 6.767123287671232, + "grad_norm": 0.5523537993431091, + "learning_rate": 6.483565488389582e-05, + "loss": 0.09709116220474243, + "mean_token_accuracy": 0.9650957375764847, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.27939334659035814, + "eval_loss": 0.7534670829772949, + "eval_mean_token_accuracy": 0.851230604010959, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.2913, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 2720 + }, + { + "entropy": 0.15991022661328316, + "epoch": 6.816936488169365, + "grad_norm": 0.478551983833313, + "learning_rate": 6.306626739450311e-05, + "loss": 0.09564646482467651, + "mean_token_accuracy": 0.9679084822535515, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.27878295491601146, + "eval_loss": 0.7519959211349487, + "eval_mean_token_accuracy": 0.8510654949864676, + "eval_num_tokens": 6397720.0, + "eval_runtime": 85.9109, + "eval_samples_per_second": 16.005, + "eval_steps_per_second": 2.002, + "step": 2740 + }, + { + "entropy": 0.16824879590421915, + "epoch": 6.866749688667497, + "grad_norm": 0.6681098937988281, + "learning_rate": 6.131198137800108e-05, + "loss": 0.0962279736995697, + "mean_token_accuracy": 0.966830012947321, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.2834690434121808, + "eval_loss": 0.751922070980072, + "eval_mean_token_accuracy": 0.8521237577809844, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.3618, + "eval_samples_per_second": 15.921, + "eval_steps_per_second": 1.992, + "step": 2760 + }, + { + "entropy": 0.1518704930320382, + "epoch": 6.916562889165629, + "grad_norm": 0.5201290249824524, + "learning_rate": 5.957332590312513e-05, + "loss": 0.09010660648345947, + "mean_token_accuracy": 0.9693463340401649, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.28485129617674404, + "eval_loss": 0.7452457547187805, + "eval_mean_token_accuracy": 0.8512036796919135, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.4524, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.99, + "step": 2780 + }, + { + "entropy": 0.15512610590085388, + "epoch": 6.966376089663761, + "grad_norm": 0.42802050709724426, + "learning_rate": 5.785082532465233e-05, + "loss": 0.09320432543754578, + "mean_token_accuracy": 0.9686134628951549, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.27554594526110693, + "eval_loss": 0.7644653916358948, + "eval_mean_token_accuracy": 0.8513738523389018, + "eval_num_tokens": 6540175.0, + "eval_runtime": 85.7609, + "eval_samples_per_second": 16.033, + "eval_steps_per_second": 2.006, + "step": 2800 + }, + { + "entropy": 0.17524497526196334, + "epoch": 7.01494396014944, + "grad_norm": 0.3330269157886505, + "learning_rate": 5.6144999125263545e-05, + "loss": 0.0895616888999939, + "mean_token_accuracy": 0.9682766932707566, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.2735865569218647, + "eval_loss": 0.768479585647583, + "eval_mean_token_accuracy": 0.8503459383581959, + "eval_num_tokens": 6583767.0, + "eval_runtime": 85.7162, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.007, + "step": 2820 + }, + { + "entropy": 0.1403565663844347, + "epoch": 7.064757160647572, + "grad_norm": 0.35613498091697693, + "learning_rate": 5.4456361758874235e-05, + "loss": 0.07551313638687134, + "mean_token_accuracy": 0.9739301167428493, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.25941789089593775, + "eval_loss": 0.8209511637687683, + "eval_mean_token_accuracy": 0.8505055855873019, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.0943, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 2840 + }, + { + "entropy": 0.13500106502324344, + "epoch": 7.114570361145703, + "grad_norm": 0.34418627619743347, + "learning_rate": 5.2785422495482234e-05, + "loss": 0.07293946146965027, + "mean_token_accuracy": 0.9747208289802074, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.26482899772912954, + "eval_loss": 0.798904538154602, + "eval_mean_token_accuracy": 0.8511530233677044, + "eval_num_tokens": 6672946.0, + "eval_runtime": 85.7915, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.005, + "step": 2860 + }, + { + "entropy": 0.13127502552233636, + "epoch": 7.164383561643835, + "grad_norm": 0.4638441503047943, + "learning_rate": 5.113268526757892e-05, + "loss": 0.07121461629867554, + "mean_token_accuracy": 0.9756786689162255, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2645381211714689, + "eval_loss": 0.809101939201355, + "eval_mean_token_accuracy": 0.8514727898115335, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.84, + "eval_samples_per_second": 16.018, + "eval_steps_per_second": 2.004, + "step": 2880 + }, + { + "entropy": 0.1331390908919275, + "epoch": 7.214196762141968, + "grad_norm": 0.40206775069236755, + "learning_rate": 4.949864851817007e-05, + "loss": 0.07188264131546021, + "mean_token_accuracy": 0.9755406074225903, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.26244733283339544, + "eval_loss": 0.8143188953399658, + "eval_mean_token_accuracy": 0.8514358189909957, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.8546, + "eval_samples_per_second": 16.015, + "eval_steps_per_second": 2.003, + "step": 2900 + }, + { + "entropy": 0.13647331558167936, + "epoch": 7.2640099626401, + "grad_norm": 0.26405787467956543, + "learning_rate": 4.788380505045224e-05, + "loss": 0.07412450313568116, + "mean_token_accuracy": 0.9744274213910102, + "num_tokens": 6809678.0, + "step": 2920 + }, + { + "epoch": 7.2640099626401, + "eval_entropy": 0.2626111418182074, + "eval_loss": 0.8111525177955627, + "eval_mean_token_accuracy": 0.8512121695418691, + "eval_num_tokens": 6809678.0, + "eval_runtime": 85.9626, + "eval_samples_per_second": 15.995, + "eval_steps_per_second": 2.001, + "step": 2920 + }, + { + "entropy": 0.12644002586603165, + "epoch": 7.313823163138232, + "grad_norm": 0.27514681220054626, + "learning_rate": 4.6288641879189884e-05, + "loss": 0.06807711124420165, + "mean_token_accuracy": 0.9760703906416893, + "num_tokens": 6860750.0, + "step": 2940 + }, + { + "epoch": 7.313823163138232, + "eval_entropy": 0.26096762734097106, + "eval_loss": 0.8184595108032227, + "eval_mean_token_accuracy": 0.8501476153384807, + "eval_num_tokens": 6860750.0, + "eval_runtime": 85.9521, + "eval_samples_per_second": 15.997, + "eval_steps_per_second": 2.001, + "step": 2940 + }, + { + "entropy": 0.13920630998909472, + "epoch": 7.363636363636363, + "grad_norm": 0.23584705591201782, + "learning_rate": 4.4713640083838604e-05, + "loss": 0.07301607131958007, + "mean_token_accuracy": 0.9745715200901032, + "num_tokens": 6907092.0, + "step": 2960 + }, + { + "epoch": 7.363636363636363, + "eval_entropy": 0.2612536767021168, + "eval_loss": 0.8116245269775391, + "eval_mean_token_accuracy": 0.8510967350976412, + "eval_num_tokens": 6907092.0, + "eval_runtime": 85.6373, + "eval_samples_per_second": 16.056, + "eval_steps_per_second": 2.008, + "step": 2960 + }, + { + "entropy": 0.1349492883309722, + "epoch": 7.4134495641344955, + "grad_norm": 0.24552719295024872, + "learning_rate": 4.315927466345791e-05, + "loss": 0.07397544980049134, + "mean_token_accuracy": 0.9745095103979111, + "num_tokens": 6952700.0, + "step": 2980 + }, + { + "epoch": 7.4134495641344955, + "eval_entropy": 0.25796533306670744, + "eval_loss": 0.8266491293907166, + "eval_mean_token_accuracy": 0.8511653857868772, + "eval_num_tokens": 6952700.0, + "eval_runtime": 85.7462, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.006, + "step": 2980 + }, + { + "entropy": 0.14479175000451505, + "epoch": 7.463262764632628, + "grad_norm": 0.2846072018146515, + "learning_rate": 4.162601439345814e-05, + "loss": 0.07544798254966736, + "mean_token_accuracy": 0.9727819666266442, + "num_tokens": 6996430.0, + "step": 3000 + }, + { + "epoch": 7.463262764632628, + "eval_entropy": 0.2584348309698493, + "eval_loss": 0.8253348469734192, + "eval_mean_token_accuracy": 0.8511569815319638, + "eval_num_tokens": 6996430.0, + "eval_runtime": 86.2984, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 3000 + }, + { + "entropy": 0.14114196319133043, + "epoch": 7.51307596513076, + "grad_norm": 0.407966285943985, + "learning_rate": 4.011432168422419e-05, + "loss": 0.0736398994922638, + "mean_token_accuracy": 0.9741654269397259, + "num_tokens": 7042038.0, + "step": 3020 + }, + { + "epoch": 7.51307596513076, + "eval_entropy": 0.25232676260693127, + "eval_loss": 0.8296052813529968, + "eval_mean_token_accuracy": 0.8523298349491385, + "eval_num_tokens": 7042038.0, + "eval_runtime": 85.8445, + "eval_samples_per_second": 16.017, + "eval_steps_per_second": 2.004, + "step": 3020 + }, + { + "entropy": 0.1353456223383546, + "epoch": 7.562889165628892, + "grad_norm": 0.2712634801864624, + "learning_rate": 3.8624652441658684e-05, + "loss": 0.07362412214279175, + "mean_token_accuracy": 0.9747945807874203, + "num_tokens": 7089390.0, + "step": 3040 + }, + { + "epoch": 7.562889165628892, + "eval_entropy": 0.2579477243991785, + "eval_loss": 0.8274564743041992, + "eval_mean_token_accuracy": 0.8517705212498821, + "eval_num_tokens": 7089390.0, + "eval_runtime": 85.8222, + "eval_samples_per_second": 16.022, + "eval_steps_per_second": 2.004, + "step": 3040 + }, + { + "entropy": 0.1296080862637609, + "epoch": 7.6127023661270234, + "grad_norm": 0.2371893972158432, + "learning_rate": 3.715745592968707e-05, + "loss": 0.06971035599708557, + "mean_token_accuracy": 0.9759043246507645, + "num_tokens": 7138002.0, + "step": 3060 + }, + { + "epoch": 7.6127023661270234, + "eval_entropy": 0.25391967083479083, + "eval_loss": 0.8197130560874939, + "eval_mean_token_accuracy": 0.8522267875283264, + "eval_num_tokens": 7138002.0, + "eval_runtime": 85.8796, + "eval_samples_per_second": 16.011, + "eval_steps_per_second": 2.003, + "step": 3060 + }, + { + "entropy": 0.1311203008517623, + "epoch": 7.662515566625156, + "grad_norm": 0.22499267756938934, + "learning_rate": 3.5713174634765967e-05, + "loss": 0.07176244258880615, + "mean_token_accuracy": 0.9754939571022987, + "num_tokens": 7185520.0, + "step": 3080 + }, + { + "epoch": 7.662515566625156, + "eval_entropy": 0.2526215241225653, + "eval_loss": 0.8265154361724854, + "eval_mean_token_accuracy": 0.8519952584837758, + "eval_num_tokens": 7185520.0, + "eval_runtime": 85.8746, + "eval_samples_per_second": 16.012, + "eval_steps_per_second": 2.003, + "step": 3080 + }, + { + "entropy": 0.13420484317466616, + "epoch": 7.712328767123288, + "grad_norm": 0.2398064285516739, + "learning_rate": 3.4292244132434866e-05, + "loss": 0.07559212446212768, + "mean_token_accuracy": 0.9743142127990723, + "num_tokens": 7232170.0, + "step": 3100 + }, + { + "epoch": 7.712328767123288, + "eval_entropy": 0.2484562756537005, + "eval_loss": 0.8312150239944458, + "eval_mean_token_accuracy": 0.8528405119513356, + "eval_num_tokens": 7232170.0, + "eval_runtime": 85.7896, + "eval_samples_per_second": 16.028, + "eval_steps_per_second": 2.005, + "step": 3100 + }, + { + "entropy": 0.11965563679113984, + "epoch": 7.76214196762142, + "grad_norm": 0.3408384919166565, + "learning_rate": 3.2895092955952746e-05, + "loss": 0.0661750853061676, + "mean_token_accuracy": 0.9776600524783134, + "num_tokens": 7282846.0, + "step": 3120 + }, + { + "epoch": 7.76214196762142, + "eval_entropy": 0.2522421533804993, + "eval_loss": 0.8327009677886963, + "eval_mean_token_accuracy": 0.8524222023958383, + "eval_num_tokens": 7282846.0, + "eval_runtime": 86.1769, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 1.996, + "step": 3120 + }, + { + "entropy": 0.13388084415346385, + "epoch": 7.811955168119551, + "grad_norm": 0.35418516397476196, + "learning_rate": 3.152214246705829e-05, + "loss": 0.07149899601936341, + "mean_token_accuracy": 0.9747635535895824, + "num_tokens": 7331518.0, + "step": 3140 + }, + { + "epoch": 7.811955168119551, + "eval_entropy": 0.25038352296795957, + "eval_loss": 0.836457371711731, + "eval_mean_token_accuracy": 0.8526130665180295, + "eval_num_tokens": 7331518.0, + "eval_runtime": 85.6099, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.009, + "step": 3140 + }, + { + "entropy": 0.13530643959529698, + "epoch": 7.861768368617684, + "grad_norm": 0.38060539960861206, + "learning_rate": 3.017380672889291e-05, + "loss": 0.07116585969924927, + "mean_token_accuracy": 0.973284512758255, + "num_tokens": 7379056.0, + "step": 3160 + }, + { + "epoch": 7.861768368617684, + "eval_entropy": 0.255092611319797, + "eval_loss": 0.8314701914787292, + "eval_mean_token_accuracy": 0.8520913099826768, + "eval_num_tokens": 7379056.0, + "eval_runtime": 85.877, + "eval_samples_per_second": 16.011, + "eval_steps_per_second": 2.003, + "step": 3160 + }, + { + "entropy": 0.13383390177041293, + "epoch": 7.911581569115816, + "grad_norm": 0.3827536106109619, + "learning_rate": 2.8850492381124808e-05, + "loss": 0.07305437326431274, + "mean_token_accuracy": 0.9750778004527092, + "num_tokens": 7424770.0, + "step": 3180 + }, + { + "epoch": 7.911581569115816, + "eval_entropy": 0.25416371157003004, + "eval_loss": 0.8206402063369751, + "eval_mean_token_accuracy": 0.852779901651449, + "eval_num_tokens": 7424770.0, + "eval_runtime": 86.1015, + "eval_samples_per_second": 15.97, + "eval_steps_per_second": 1.998, + "step": 3180 + }, + { + "entropy": 0.1395680439658463, + "epoch": 7.961394769613948, + "grad_norm": 0.3809775412082672, + "learning_rate": 2.7552598517312256e-05, + "loss": 0.07236042022705078, + "mean_token_accuracy": 0.9731538116931915, + "num_tokens": 7470804.0, + "step": 3200 + }, + { + "epoch": 7.961394769613948, + "eval_entropy": 0.25528111975899964, + "eval_loss": 0.8230037093162537, + "eval_mean_token_accuracy": 0.8526452603035195, + "eval_num_tokens": 7470804.0, + "eval_runtime": 85.7895, + "eval_samples_per_second": 16.028, + "eval_steps_per_second": 2.005, + "step": 3200 + }, + { + "entropy": 0.12193699864049752, + "epoch": 8.009962640099626, + "grad_norm": 0.11854425817728043, + "learning_rate": 2.6280516564542205e-05, + "loss": 0.06617764234542847, + "mean_token_accuracy": 0.977179691577569, + "num_tokens": 7518110.0, + "step": 3220 + }, + { + "epoch": 8.009962640099626, + "eval_entropy": 0.25100527677771656, + "eval_loss": 0.8393343687057495, + "eval_mean_token_accuracy": 0.8522553132023922, + "eval_num_tokens": 7518110.0, + "eval_runtime": 85.8837, + "eval_samples_per_second": 16.01, + "eval_steps_per_second": 2.003, + "step": 3220 + }, + { + "entropy": 0.12788885813206435, + "epoch": 8.059775840597759, + "grad_norm": 0.16094881296157837, + "learning_rate": 2.50346301653812e-05, + "loss": 0.06274186968803405, + "mean_token_accuracy": 0.9766994707286358, + "num_tokens": 7565539.0, + "step": 3240 + }, + { + "epoch": 8.059775840597759, + "eval_entropy": 0.24409458682287571, + "eval_loss": 0.874617338180542, + "eval_mean_token_accuracy": 0.8521041180505309, + "eval_num_tokens": 7565539.0, + "eval_runtime": 86.2656, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 3240 + }, + { + "entropy": 0.12464155335910618, + "epoch": 8.10958904109589, + "grad_norm": 0.16893954575061798, + "learning_rate": 2.381531506217437e-05, + "loss": 0.06093020439147949, + "mean_token_accuracy": 0.9776258453726768, + "num_tokens": 7612578.0, + "step": 3260 + }, + { + "epoch": 8.10958904109589, + "eval_entropy": 0.24396493017326953, + "eval_loss": 0.891161322593689, + "eval_mean_token_accuracy": 0.8515338024427724, + "eval_num_tokens": 7612578.0, + "eval_runtime": 85.9061, + "eval_samples_per_second": 16.006, + "eval_steps_per_second": 2.002, + "step": 3260 + }, + { + "entropy": 0.12345920228399336, + "epoch": 8.159402241594023, + "grad_norm": 0.14332273602485657, + "learning_rate": 2.262293898372616e-05, + "loss": 0.061289966106414795, + "mean_token_accuracy": 0.9762230902910233, + "num_tokens": 7660157.0, + "step": 3280 + }, + { + "epoch": 8.159402241594023, + "eval_entropy": 0.2481445314059424, + "eval_loss": 0.8922848105430603, + "eval_mean_token_accuracy": 0.8514944855556932, + "eval_num_tokens": 7660157.0, + "eval_runtime": 85.5201, + "eval_samples_per_second": 16.078, + "eval_steps_per_second": 2.011, + "step": 3280 + }, + { + "entropy": 0.12298110066913068, + "epoch": 8.209215442092155, + "grad_norm": 0.21848882734775543, + "learning_rate": 2.1457861534398633e-05, + "loss": 0.05986443758010864, + "mean_token_accuracy": 0.9786281704902648, + "num_tokens": 7709745.0, + "step": 3300 + }, + { + "epoch": 8.209215442092155, + "eval_entropy": 0.24329388124305149, + "eval_loss": 0.9021085500717163, + "eval_mean_token_accuracy": 0.8521762625422589, + "eval_num_tokens": 7709745.0, + "eval_runtime": 85.955, + "eval_samples_per_second": 15.997, + "eval_steps_per_second": 2.001, + "step": 3300 + }, + { + "entropy": 0.13265180448070168, + "epoch": 8.259028642590286, + "grad_norm": 0.18067947030067444, + "learning_rate": 2.0320434085659692e-05, + "loss": 0.06724961400032044, + "mean_token_accuracy": 0.975098168104887, + "num_tokens": 7753571.0, + "step": 3320 + }, + { + "epoch": 8.259028642590286, + "eval_entropy": 0.2433211464694766, + "eval_loss": 0.9094350337982178, + "eval_mean_token_accuracy": 0.8520150094531304, + "eval_num_tokens": 7753571.0, + "eval_runtime": 85.7989, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.005, + "step": 3320 + }, + { + "entropy": 0.11949320202693343, + "epoch": 8.308841843088418, + "grad_norm": 0.17020289599895477, + "learning_rate": 1.9210999670114196e-05, + "loss": 0.0634455680847168, + "mean_token_accuracy": 0.9771294385194779, + "num_tokens": 7799310.0, + "step": 3340 + }, + { + "epoch": 8.308841843088418, + "eval_entropy": 0.24345201219237128, + "eval_loss": 0.9021793603897095, + "eval_mean_token_accuracy": 0.8520745697409607, + "eval_num_tokens": 7799310.0, + "eval_runtime": 86.0883, + "eval_samples_per_second": 15.972, + "eval_steps_per_second": 1.998, + "step": 3340 + }, + { + "entropy": 0.12065747743472457, + "epoch": 8.35865504358655, + "grad_norm": 0.16789060831069946, + "learning_rate": 1.8129892878049886e-05, + "loss": 0.061494195461273195, + "mean_token_accuracy": 0.9779584899544715, + "num_tokens": 7846447.0, + "step": 3360 + }, + { + "epoch": 8.35865504358655, + "eval_entropy": 0.24093415042342142, + "eval_loss": 0.9006755352020264, + "eval_mean_token_accuracy": 0.852174230786257, + "eval_num_tokens": 7846447.0, + "eval_runtime": 85.9011, + "eval_samples_per_second": 16.007, + "eval_steps_per_second": 2.002, + "step": 3360 + }, + { + "entropy": 0.13125578537583352, + "epoch": 8.408468244084682, + "grad_norm": 0.1662452220916748, + "learning_rate": 1.70774397565298e-05, + "loss": 0.06685600876808166, + "mean_token_accuracy": 0.9744067586958408, + "num_tokens": 7890283.0, + "step": 3380 + }, + { + "epoch": 8.408468244084682, + "eval_entropy": 0.24062153688350388, + "eval_loss": 0.9078915119171143, + "eval_mean_token_accuracy": 0.8523201647886011, + "eval_num_tokens": 7890283.0, + "eval_runtime": 86.0201, + "eval_samples_per_second": 15.985, + "eval_steps_per_second": 2.0, + "step": 3380 + }, + { + "entropy": 0.11986117120832204, + "epoch": 8.458281444582815, + "grad_norm": 0.19571948051452637, + "learning_rate": 1.6053957711060606e-05, + "loss": 0.06411095261573792, + "mean_token_accuracy": 0.9770627245306969, + "num_tokens": 7936518.0, + "step": 3400 + }, + { + "epoch": 8.458281444582815, + "eval_entropy": 0.24352820347561394, + "eval_loss": 0.9058943390846252, + "eval_mean_token_accuracy": 0.8519382792156797, + "eval_num_tokens": 7936518.0, + "eval_runtime": 85.966, + "eval_samples_per_second": 15.995, + "eval_steps_per_second": 2.001, + "step": 3400 + }, + { + "entropy": 0.12857897616922856, + "epoch": 8.508094645080947, + "grad_norm": 0.2609264850616455, + "learning_rate": 1.5059755409867613e-05, + "loss": 0.06473397612571716, + "mean_token_accuracy": 0.9764650195837021, + "num_tokens": 7981966.0, + "step": 3420 + }, + { + "epoch": 8.508094645080947, + "eval_entropy": 0.24032609000108962, + "eval_loss": 0.9077776074409485, + "eval_mean_token_accuracy": 0.8517829197090726, + "eval_num_tokens": 7981966.0, + "eval_runtime": 86.6059, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 3420 + }, + { + "entropy": 0.12348870886489749, + "epoch": 8.557907845579079, + "grad_norm": 0.19537609815597534, + "learning_rate": 1.409513269080473e-05, + "loss": 0.06481348872184753, + "mean_token_accuracy": 0.9769559659063816, + "num_tokens": 8028367.0, + "step": 3440 + }, + { + "epoch": 8.557907845579079, + "eval_entropy": 0.2404322574824788, + "eval_loss": 0.9057720899581909, + "eval_mean_token_accuracy": 0.8521037981953732, + "eval_num_tokens": 8028367.0, + "eval_runtime": 86.166, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.996, + "step": 3440 + }, + { + "entropy": 0.12040232736617326, + "epoch": 8.607721046077211, + "grad_norm": 0.3310582935810089, + "learning_rate": 1.3160380470927183e-05, + "loss": 0.06468871235847473, + "mean_token_accuracy": 0.9768650442361831, + "num_tokens": 8074934.0, + "step": 3460 + }, + { + "epoch": 8.607721046077211, + "eval_entropy": 0.24118655876711356, + "eval_loss": 0.9028318524360657, + "eval_mean_token_accuracy": 0.8521025340224422, + "eval_num_tokens": 8074934.0, + "eval_runtime": 85.3668, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.015, + "step": 3460 + }, + { + "entropy": 0.12328103906475008, + "epoch": 8.657534246575342, + "grad_norm": 0.12836167216300964, + "learning_rate": 1.2255780658755122e-05, + "loss": 0.06229386329650879, + "mean_token_accuracy": 0.9763277888298034, + "num_tokens": 8122775.0, + "step": 3480 + }, + { + "epoch": 8.657534246575342, + "eval_entropy": 0.24194598145956217, + "eval_loss": 0.9009329080581665, + "eval_mean_token_accuracy": 0.8521693289973015, + "eval_num_tokens": 8122775.0, + "eval_runtime": 85.9415, + "eval_samples_per_second": 15.999, + "eval_steps_per_second": 2.001, + "step": 3480 + }, + { + "entropy": 0.11321646976284683, + "epoch": 8.707347447073474, + "grad_norm": 0.15656894445419312, + "learning_rate": 1.1381606069253786e-05, + "loss": 0.05908188819885254, + "mean_token_accuracy": 0.9779504477977753, + "num_tokens": 8174307.0, + "step": 3500 + }, + { + "epoch": 8.707347447073474, + "eval_entropy": 0.24121542517528977, + "eval_loss": 0.9016091823577881, + "eval_mean_token_accuracy": 0.8521790667328724, + "eval_num_tokens": 8174307.0, + "eval_runtime": 85.7465, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.006, + "step": 3500 + }, + { + "entropy": 0.12657046681270004, + "epoch": 8.757160647571606, + "grad_norm": 0.22597502171993256, + "learning_rate": 1.053812034155629e-05, + "loss": 0.06244581937789917, + "mean_token_accuracy": 0.976795207709074, + "num_tokens": 8222808.0, + "step": 3520 + }, + { + "epoch": 8.757160647571606, + "eval_entropy": 0.23877542708502258, + "eval_loss": 0.9069110155105591, + "eval_mean_token_accuracy": 0.8522880177858264, + "eval_num_tokens": 8222808.0, + "eval_runtime": 85.7792, + "eval_samples_per_second": 16.03, + "eval_steps_per_second": 2.005, + "step": 3520 + }, + { + "entropy": 0.11422101808711886, + "epoch": 8.806973848069738, + "grad_norm": 0.21139323711395264, + "learning_rate": 9.725577859453502e-06, + "loss": 0.05988085865974426, + "mean_token_accuracy": 0.9779510758817196, + "num_tokens": 8273335.0, + "step": 3540 + }, + { + "epoch": 8.806973848069738, + "eval_entropy": 0.2393161087881687, + "eval_loss": 0.9033801555633545, + "eval_mean_token_accuracy": 0.8522614209457885, + "eval_num_tokens": 8273335.0, + "eval_runtime": 85.5594, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 3540 + }, + { + "entropy": 0.13810604228638113, + "epoch": 8.85678704856787, + "grad_norm": 0.24571993947029114, + "learning_rate": 8.944223674675537e-06, + "loss": 0.07036117911338806, + "mean_token_accuracy": 0.9734892748296261, + "num_tokens": 8315235.0, + "step": 3560 + }, + { + "epoch": 8.85678704856787, + "eval_entropy": 0.23998506947658782, + "eval_loss": 0.9009848833084106, + "eval_mean_token_accuracy": 0.8521793619837872, + "eval_num_tokens": 8315235.0, + "eval_runtime": 86.0974, + "eval_samples_per_second": 15.97, + "eval_steps_per_second": 1.998, + "step": 3560 + }, + { + "entropy": 0.14193559321574867, + "epoch": 8.906600249066003, + "grad_norm": 0.17304112017154694, + "learning_rate": 8.194293432987386e-06, + "loss": 0.07077967524528503, + "mean_token_accuracy": 0.973305893689394, + "num_tokens": 8358099.0, + "step": 3580 + }, + { + "epoch": 8.906600249066003, + "eval_entropy": 0.23883876689644748, + "eval_loss": 0.9015622138977051, + "eval_mean_token_accuracy": 0.8524864378363587, + "eval_num_tokens": 8358099.0, + "eval_runtime": 86.0089, + "eval_samples_per_second": 15.987, + "eval_steps_per_second": 2.0, + "step": 3580 + }, + { + "entropy": 0.11878943420015275, + "epoch": 8.956413449564135, + "grad_norm": 0.19075658917427063, + "learning_rate": 7.476013303121426e-06, + "loss": 0.060806107521057126, + "mean_token_accuracy": 0.9776863709092141, + "num_tokens": 8407430.0, + "step": 3600 + }, + { + "epoch": 8.956413449564135, + "eval_entropy": 0.23726526309931, + "eval_loss": 0.9060276746749878, + "eval_mean_token_accuracy": 0.8524192058762838, + "eval_num_tokens": 8407430.0, + "eval_runtime": 85.7252, + "eval_samples_per_second": 16.04, + "eval_steps_per_second": 2.006, + "step": 3600 + }, + { + "entropy": 0.1255835090787747, + "epoch": 9.004981320049813, + "grad_norm": 0.11608047038316727, + "learning_rate": 6.78959990856799e-06, + "loss": 0.06319612860679627, + "mean_token_accuracy": 0.9766685519462976, + "num_tokens": 8453175.0, + "step": 3620 + }, + { + "epoch": 9.004981320049813, + "eval_entropy": 0.2373251837006835, + "eval_loss": 0.9045722484588623, + "eval_mean_token_accuracy": 0.8525558363559634, + "eval_num_tokens": 8453175.0, + "eval_runtime": 85.7435, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.006, + "step": 3620 + }, + { + "entropy": 0.12587778437882663, + "epoch": 9.054794520547945, + "grad_norm": 0.1564614623785019, + "learning_rate": 6.135260262244683e-06, + "loss": 0.0630365788936615, + "mean_token_accuracy": 0.9777486085891723, + "num_tokens": 8497151.0, + "step": 3640 + }, + { + "epoch": 9.054794520547945, + "eval_entropy": 0.23559923721260803, + "eval_loss": 0.9120694398880005, + "eval_mean_token_accuracy": 0.8525292966947999, + "eval_num_tokens": 8497151.0, + "eval_runtime": 85.8018, + "eval_samples_per_second": 16.025, + "eval_steps_per_second": 2.005, + "step": 3640 + }, + { + "entropy": 0.12535365503281354, + "epoch": 9.104607721046078, + "grad_norm": 0.1404249221086502, + "learning_rate": 5.513191704064086e-06, + "loss": 0.060502654314041136, + "mean_token_accuracy": 0.9770058333873749, + "num_tokens": 8542996.0, + "step": 3660 + }, + { + "epoch": 9.104607721046078, + "eval_entropy": 0.23525122691725575, + "eval_loss": 0.9182237982749939, + "eval_mean_token_accuracy": 0.8524098333924316, + "eval_num_tokens": 8542996.0, + "eval_runtime": 85.9872, + "eval_samples_per_second": 15.991, + "eval_steps_per_second": 2.0, + "step": 3660 + }, + { + "entropy": 0.11330419047735632, + "epoch": 9.15442092154421, + "grad_norm": 0.15513843297958374, + "learning_rate": 4.92358184141876e-06, + "loss": 0.05822383761405945, + "mean_token_accuracy": 0.9793384782969952, + "num_tokens": 8591625.0, + "step": 3680 + }, + { + "epoch": 9.15442092154421, + "eval_entropy": 0.2353947116711805, + "eval_loss": 0.9229223132133484, + "eval_mean_token_accuracy": 0.852500357253607, + "eval_num_tokens": 8591625.0, + "eval_runtime": 86.0805, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.998, + "step": 3680 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.626792600127836e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3700/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3700/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3700/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3700/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3700/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3700/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3700/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3700/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3700/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3700/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3700/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3700/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3700/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3700/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..d46412d97cabcc8df1eaabdfa631cf39c46919a5 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3700/trainer_state.json @@ -0,0 +1,3919 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 9.204234122042342, + "eval_steps": 20, + "global_step": 3700, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + }, + { + "entropy": 0.561330484598875, + "epoch": 1.891656288916563, + "grad_norm": 0.6722865700721741, + "learning_rate": 0.0002208867897174789, + "loss": 0.499837589263916, + "mean_token_accuracy": 0.8518734864890576, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.5865232653396074, + "eval_loss": 0.5437926650047302, + "eval_mean_token_accuracy": 0.8450997017843779, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4116, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.547389242425561, + "epoch": 1.9414694894146949, + "grad_norm": 0.7935577034950256, + "learning_rate": 0.00022027119820226907, + "loss": 0.4977591514587402, + "mean_token_accuracy": 0.8539491161704064, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.5290903090391048, + "eval_loss": 0.5409526824951172, + "eval_mean_token_accuracy": 0.8497545698354411, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.7262, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 780 + }, + { + "entropy": 0.5687909748405218, + "epoch": 1.9912826899128269, + "grad_norm": 0.6180546283721924, + "learning_rate": 0.00021962329729698345, + "loss": 0.5109643459320068, + "mean_token_accuracy": 0.8521598495543004, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.5503541858390321, + "eval_loss": 0.5361555218696594, + "eval_mean_token_accuracy": 0.8510884285666221, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.3339, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 800 + }, + { + "entropy": 0.4739728841261986, + "epoch": 2.0398505603985058, + "grad_norm": 0.8058829307556152, + "learning_rate": 0.0002189432823996982, + "loss": 0.4204097747802734, + "mean_token_accuracy": 0.8728981889211215, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.5077334992414297, + "eval_loss": 0.5531114339828491, + "eval_mean_token_accuracy": 0.8489257208136625, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.4801, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.989, + "step": 820 + }, + { + "entropy": 0.4594309840351343, + "epoch": 2.0896637608966375, + "grad_norm": 0.6906896829605103, + "learning_rate": 0.0002182313585936314, + "loss": 0.4071959495544434, + "mean_token_accuracy": 0.8732857562601566, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.49850136994622474, + "eval_loss": 0.5486204624176025, + "eval_mean_token_accuracy": 0.8507991450470548, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.3364, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.4881629109382629, + "epoch": 2.1394769613947697, + "grad_norm": 0.6343470215797424, + "learning_rate": 0.0002174877405852928, + "loss": 0.41669540405273436, + "mean_token_accuracy": 0.8711295068264008, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.49155513924914734, + "eval_loss": 0.555109441280365, + "eval_mean_token_accuracy": 0.8496399400539176, + "eval_num_tokens": 2008562.0, + "eval_runtime": 86.3295, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 860 + }, + { + "entropy": 0.4648668970912695, + "epoch": 2.1892901618929015, + "grad_norm": 0.8014165163040161, + "learning_rate": 0.00021671265263973133, + "loss": 0.4110250473022461, + "mean_token_accuracy": 0.8754166305065155, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.4909258722219356, + "eval_loss": 0.5539511442184448, + "eval_mean_token_accuracy": 0.8492401502160138, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.3468, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 880 + }, + { + "entropy": 0.4824485514312983, + "epoch": 2.2391033623910337, + "grad_norm": 0.6665191054344177, + "learning_rate": 0.00021590632851289967, + "loss": 0.4181404113769531, + "mean_token_accuracy": 0.8726993151009083, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.4986876940657926, + "eval_loss": 0.547695517539978, + "eval_mean_token_accuracy": 0.8501384708770486, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.3838, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 900 + }, + { + "entropy": 0.4751896943897009, + "epoch": 2.2889165628891655, + "grad_norm": 0.81158047914505, + "learning_rate": 0.00021506901138115678, + "loss": 0.40689678192138673, + "mean_token_accuracy": 0.8745221219956875, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.507153491121392, + "eval_loss": 0.5501641631126404, + "eval_mean_token_accuracy": 0.8495670116918032, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.0912, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 920 + }, + { + "entropy": 0.4873133715242147, + "epoch": 2.3387297633872977, + "grad_norm": 0.7218056321144104, + "learning_rate": 0.0002142009537679292, + "loss": 0.42701358795166017, + "mean_token_accuracy": 0.8695114746689796, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5202612736543943, + "eval_loss": 0.5491839051246643, + "eval_mean_token_accuracy": 0.8494071208460386, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.1142, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 940 + }, + { + "entropy": 0.4762951169162989, + "epoch": 2.3885429638854294, + "grad_norm": 0.7194424867630005, + "learning_rate": 0.0002133024174675534, + "loss": 0.42299847602844237, + "mean_token_accuracy": 0.8709790132939815, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4899340462546016, + "eval_loss": 0.5522511601448059, + "eval_mean_token_accuracy": 0.8492208258357159, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.463, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 960 + }, + { + "entropy": 0.49650347977876663, + "epoch": 2.4383561643835616, + "grad_norm": 0.8406022787094116, + "learning_rate": 0.0002123736734663221, + "loss": 0.4275330066680908, + "mean_token_accuracy": 0.8670595556497573, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.49691385654515996, + "eval_loss": 0.5491269826889038, + "eval_mean_token_accuracy": 0.850309816210769, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.17, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 980 + }, + { + "entropy": 0.48843890577554705, + "epoch": 2.488169364881694, + "grad_norm": 0.9082473516464233, + "learning_rate": 0.00021141500186075868, + "loss": 0.4309722423553467, + "mean_token_accuracy": 0.8686766296625137, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5543508351195691, + "eval_loss": 0.5478800535202026, + "eval_mean_token_accuracy": 0.8478029522784921, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.3835, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 1000 + }, + { + "entropy": 0.4777219031006098, + "epoch": 2.5379825653798256, + "grad_norm": 0.7448089122772217, + "learning_rate": 0.0002104266917731438, + "loss": 0.423325252532959, + "mean_token_accuracy": 0.8706337086856365, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.49857561550168106, + "eval_loss": 0.5511948466300964, + "eval_mean_token_accuracy": 0.8502220289651737, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.5399, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.988, + "step": 1020 + }, + { + "entropy": 0.4844174191355705, + "epoch": 2.587795765877958, + "grad_norm": 0.794029176235199, + "learning_rate": 0.00020940904126432, + "loss": 0.4176753044128418, + "mean_token_accuracy": 0.873535567522049, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.485467542222766, + "eval_loss": 0.5539286732673645, + "eval_mean_token_accuracy": 0.8495475081510322, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.135, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 1.997, + "step": 1040 + }, + { + "entropy": 0.49070929251611234, + "epoch": 2.6376089663760895, + "grad_norm": 0.7558256983757019, + "learning_rate": 0.0002083623572438007, + "loss": 0.42867293357849123, + "mean_token_accuracy": 0.8696666076779366, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.490822730889154, + "eval_loss": 0.5434785485267639, + "eval_mean_token_accuracy": 0.850568296950917, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.4933, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 1060 + }, + { + "entropy": 0.47806114703416824, + "epoch": 2.6874221668742218, + "grad_norm": 0.6608979105949402, + "learning_rate": 0.00020728695537721047, + "loss": 0.4289727687835693, + "mean_token_accuracy": 0.8693130135536193, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.5285773256490397, + "eval_loss": 0.5444230437278748, + "eval_mean_token_accuracy": 0.8498796481032704, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.7091, + "eval_samples_per_second": 15.858, + "eval_steps_per_second": 1.984, + "step": 1080 + }, + { + "entropy": 0.5046216730028391, + "epoch": 2.7372353673723535, + "grad_norm": 0.8428544998168945, + "learning_rate": 0.00020618315999108454, + "loss": 0.43131070137023925, + "mean_token_accuracy": 0.8701941035687923, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.49888394738352576, + "eval_loss": 0.5459766387939453, + "eval_mean_token_accuracy": 0.8511758872935938, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.2222, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.995, + "step": 1100 + }, + { + "entropy": 0.5212558470666409, + "epoch": 2.7870485678704857, + "grad_norm": 1.129318118095398, + "learning_rate": 0.00020505130397505635, + "loss": 0.44249300956726073, + "mean_token_accuracy": 0.8654101334512234, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5179622324053631, + "eval_loss": 0.5522801280021667, + "eval_mean_token_accuracy": 0.8497019947268242, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.1903, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.996, + "step": 1120 + }, + { + "entropy": 0.4988406613469124, + "epoch": 2.8368617683686175, + "grad_norm": 0.6460545063018799, + "learning_rate": 0.00020389172868146263, + "loss": 0.4386270523071289, + "mean_token_accuracy": 0.8690383620560169, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.5042278484203094, + "eval_loss": 0.5433034300804138, + "eval_mean_token_accuracy": 0.8497674451317898, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.3028, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.993, + "step": 1140 + }, + { + "entropy": 0.4926559619605541, + "epoch": 2.8866749688667497, + "grad_norm": 0.8199329972267151, + "learning_rate": 0.00020270478382239615, + "loss": 0.4313485145568848, + "mean_token_accuracy": 0.8674727231264114, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.503873193160046, + "eval_loss": 0.5388111472129822, + "eval_mean_token_accuracy": 0.8526195034731266, + "eval_num_tokens": 2710196.0, + "eval_runtime": 86.4054, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.991, + "step": 1160 + }, + { + "entropy": 0.5020013231784105, + "epoch": 2.936488169364882, + "grad_norm": 0.7344821095466614, + "learning_rate": 0.00020149082736423723, + "loss": 0.43590536117553713, + "mean_token_accuracy": 0.8671772189438343, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5368241809828337, + "eval_loss": 0.5355703830718994, + "eval_mean_token_accuracy": 0.8517617773871089, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.2945, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1180 + }, + { + "entropy": 0.5112275708466768, + "epoch": 2.9863013698630136, + "grad_norm": 0.6951606869697571, + "learning_rate": 0.00020025022541969622, + "loss": 0.43579301834106443, + "mean_token_accuracy": 0.8641206480562686, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.5066795706055885, + "eval_loss": 0.5415249466896057, + "eval_mean_token_accuracy": 0.8493563373421513, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.5005, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.988, + "step": 1200 + }, + { + "entropy": 0.42298635305502474, + "epoch": 3.0348692403486925, + "grad_norm": 0.8201794028282166, + "learning_rate": 0.00019898335213739863, + "loss": 0.35593905448913576, + "mean_token_accuracy": 0.889238600547497, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.4584170470750609, + "eval_loss": 0.569487452507019, + "eval_mean_token_accuracy": 0.8495814173027526, + "eval_num_tokens": 2848509.0, + "eval_runtime": 86.2281, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 1220 + }, + { + "entropy": 0.37450140453875064, + "epoch": 3.0846824408468243, + "grad_norm": 0.7308394908905029, + "learning_rate": 0.0001976905895890471, + "loss": 0.307823920249939, + "mean_token_accuracy": 0.9001288741827012, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.45185995916294497, + "eval_loss": 0.5672881603240967, + "eval_mean_token_accuracy": 0.8511318519364955, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.0819, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.998, + "step": 1240 + }, + { + "entropy": 0.3887945845723152, + "epoch": 3.1344956413449565, + "grad_norm": 0.7299330830574036, + "learning_rate": 0.0001963723276541939, + "loss": 0.32047903537750244, + "mean_token_accuracy": 0.8960984498262405, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.44865354549053105, + "eval_loss": 0.5666037201881409, + "eval_mean_token_accuracy": 0.8496572649063066, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 1260 + }, + { + "entropy": 0.39677664265036583, + "epoch": 3.1843088418430883, + "grad_norm": 0.9533219933509827, + "learning_rate": 0.00019502896390265838, + "loss": 0.3253983497619629, + "mean_token_accuracy": 0.8964207418262958, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.4641980809527774, + "eval_loss": 0.5814996957778931, + "eval_mean_token_accuracy": 0.8485886212005171, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.7784, + "eval_samples_per_second": 15.845, + "eval_steps_per_second": 1.982, + "step": 1280 + }, + { + "entropy": 0.39210722744464876, + "epoch": 3.2341220423412205, + "grad_norm": 0.7447651028633118, + "learning_rate": 0.00019366090347462545, + "loss": 0.3276803970336914, + "mean_token_accuracy": 0.8930055953562259, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43595615254585135, + "eval_loss": 0.5722188353538513, + "eval_mean_token_accuracy": 0.8501105755567551, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.5271, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 1300 + }, + { + "entropy": 0.3684127271175385, + "epoch": 3.2839352428393527, + "grad_norm": 0.6934201121330261, + "learning_rate": 0.00019226855895846078, + "loss": 0.3156379222869873, + "mean_token_accuracy": 0.8976306475698947, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.4628148723480313, + "eval_loss": 0.5631352066993713, + "eval_mean_token_accuracy": 0.8504934813394103, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.3436, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 1320 + }, + { + "entropy": 0.4073401909321547, + "epoch": 3.3337484433374844, + "grad_norm": 0.9386897683143616, + "learning_rate": 0.00019085235026627994, + "loss": 0.34265310764312745, + "mean_token_accuracy": 0.8902062118053437, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.46455050623694133, + "eval_loss": 0.5586736798286438, + "eval_mean_token_accuracy": 0.8506874702004499, + "eval_num_tokens": 3132874.0, + "eval_runtime": 86.1286, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.997, + "step": 1340 + }, + { + "entropy": 0.4046429242938757, + "epoch": 3.383561643835616, + "grad_norm": 0.9633992314338684, + "learning_rate": 0.00018941270450730836, + "loss": 0.33816893100738527, + "mean_token_accuracy": 0.8927541889250279, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.46846531660750856, + "eval_loss": 0.561501681804657, + "eval_mean_token_accuracy": 0.8496256377114806, + "eval_num_tokens": 3178055.0, + "eval_runtime": 86.685, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1360 + }, + { + "entropy": 0.39872407019138334, + "epoch": 3.4333748443337484, + "grad_norm": 0.7786458730697632, + "learning_rate": 0.00018795005585907113, + "loss": 0.33342490196228025, + "mean_token_accuracy": 0.8944805048406124, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.42709505973860273, + "eval_loss": 0.5751848220825195, + "eval_mean_token_accuracy": 0.8507290447867194, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.6892, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 1380 + }, + { + "entropy": 0.3923338124528527, + "epoch": 3.4831880448318806, + "grad_norm": 0.9305956363677979, + "learning_rate": 0.0001864648454364511, + "loss": 0.33188116550445557, + "mean_token_accuracy": 0.8943330392241478, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.4386174779298694, + "eval_loss": 0.5680831074714661, + "eval_mean_token_accuracy": 0.8513129727784977, + "eval_num_tokens": 3274096.0, + "eval_runtime": 86.2671, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 1400 + }, + { + "entropy": 0.3856233984231949, + "epoch": 3.5330012453300124, + "grad_norm": 1.0362752676010132, + "learning_rate": 0.0001849575211586545, + "loss": 0.33098697662353516, + "mean_token_accuracy": 0.8961390435695649, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4574795474493226, + "eval_loss": 0.5630439519882202, + "eval_mean_token_accuracy": 0.8520988873964133, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.6035, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 1420 + }, + { + "entropy": 0.39812871962785723, + "epoch": 3.5828144458281446, + "grad_norm": 0.7807195782661438, + "learning_rate": 0.0001834285376141247, + "loss": 0.3333771228790283, + "mean_token_accuracy": 0.8930827379226685, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.4556825893909432, + "eval_loss": 0.5689062476158142, + "eval_mean_token_accuracy": 0.8507103507601937, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.1606, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.996, + "step": 1440 + }, + { + "entropy": 0.4147744856774807, + "epoch": 3.6326276463262763, + "grad_norm": 0.6429352164268494, + "learning_rate": 0.00018187835592344443, + "loss": 0.3482560873031616, + "mean_token_accuracy": 0.8910200245678425, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.46600024540757023, + "eval_loss": 0.5609709024429321, + "eval_mean_token_accuracy": 0.8491220876227977, + "eval_num_tokens": 3415600.0, + "eval_runtime": 86.8039, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1460 + }, + { + "entropy": 0.40425071083009245, + "epoch": 3.6824408468244085, + "grad_norm": 0.8613698482513428, + "learning_rate": 0.0001803074436002682, + "loss": 0.342916464805603, + "mean_token_accuracy": 0.8916418336331844, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.43855057899342026, + "eval_loss": 0.5720968246459961, + "eval_mean_token_accuracy": 0.8500823641932288, + "eval_num_tokens": 3460471.0, + "eval_runtime": 86.6746, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1480 + }, + { + "entropy": 0.39465143866837027, + "epoch": 3.7322540473225407, + "grad_norm": 0.6285189986228943, + "learning_rate": 0.0001787162744103265, + "loss": 0.3424591779708862, + "mean_token_accuracy": 0.8906558901071548, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4509461877304454, + "eval_loss": 0.5590082406997681, + "eval_mean_token_accuracy": 0.8511747371318729, + "eval_num_tokens": 3507647.0, + "eval_runtime": 86.8126, + "eval_samples_per_second": 15.839, + "eval_steps_per_second": 1.981, + "step": 1500 + }, + { + "entropy": 0.4021005939692259, + "epoch": 3.7820672478206725, + "grad_norm": 0.8821248412132263, + "learning_rate": 0.00017710532822854468, + "loss": 0.3462103843688965, + "mean_token_accuracy": 0.889109355956316, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.4502199075596277, + "eval_loss": 0.566046416759491, + "eval_mean_token_accuracy": 0.8501714208098345, + "eval_num_tokens": 3548934.0, + "eval_runtime": 86.8336, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.981, + "step": 1520 + }, + { + "entropy": 0.4017397932708263, + "epoch": 3.8318804483188043, + "grad_norm": 0.8400952816009521, + "learning_rate": 0.0001754750908943189, + "loss": 0.34890995025634763, + "mean_token_accuracy": 0.8892098367214203, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.4614003023435903, + "eval_loss": 0.5617933869361877, + "eval_mean_token_accuracy": 0.8515863616106122, + "eval_num_tokens": 3597186.0, + "eval_runtime": 86.4609, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 1540 + }, + { + "entropy": 0.4112051840871572, + "epoch": 3.8816936488169365, + "grad_norm": 0.769478440284729, + "learning_rate": 0.0001738260540649939, + "loss": 0.34711437225341796, + "mean_token_accuracy": 0.8911717928946018, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4540443811998811, + "eval_loss": 0.5576469898223877, + "eval_mean_token_accuracy": 0.8512079674144124, + "eval_num_tokens": 3646646.0, + "eval_runtime": 86.5103, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 1560 + }, + { + "entropy": 0.41105241514742374, + "epoch": 3.9315068493150687, + "grad_norm": 0.8468427062034607, + "learning_rate": 0.00017215871506758568, + "loss": 0.3433023452758789, + "mean_token_accuracy": 0.8898739732801915, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.4707539707075718, + "eval_loss": 0.5641466379165649, + "eval_mean_token_accuracy": 0.8495440957851188, + "eval_num_tokens": 3689560.0, + "eval_runtime": 86.609, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.986, + "step": 1580 + }, + { + "entropy": 0.41016379147768023, + "epoch": 3.9813200498132004, + "grad_norm": 0.7482675313949585, + "learning_rate": 0.0001704735767487946, + "loss": 0.34550890922546384, + "mean_token_accuracy": 0.8893028847873211, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.46391099864660307, + "eval_loss": 0.5593640804290771, + "eval_mean_token_accuracy": 0.8510130581467651, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.3975, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 1600 + }, + { + "entropy": 0.33167599791135544, + "epoch": 4.029887920298879, + "grad_norm": 0.9435692429542542, + "learning_rate": 0.00016877114732335337, + "loss": 0.2716026544570923, + "mean_token_accuracy": 0.9133149828666296, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.38499350005457567, + "eval_loss": 0.6298249363899231, + "eval_mean_token_accuracy": 0.8488117071778275, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.2933, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1620 + }, + { + "entropy": 0.3000166634097695, + "epoch": 4.0797011207970115, + "grad_norm": 0.8080845475196838, + "learning_rate": 0.0001670519402207569, + "loss": 0.22617182731628419, + "mean_token_accuracy": 0.9253474645316601, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.370110988703578, + "eval_loss": 0.6338461637496948, + "eval_mean_token_accuracy": 0.8485634801692741, + "eval_num_tokens": 3828830.0, + "eval_runtime": 85.9508, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.001, + "step": 1640 + }, + { + "entropy": 0.2986910421401262, + "epoch": 4.129514321295143, + "grad_norm": 0.7310900092124939, + "learning_rate": 0.0001653164739304185, + "loss": 0.22367463111877442, + "mean_token_accuracy": 0.9252275295555592, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.3944379702037157, + "eval_loss": 0.6109381914138794, + "eval_mean_token_accuracy": 0.849291454220927, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.6728, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1660 + }, + { + "entropy": 0.3095553796738386, + "epoch": 4.179327521793275, + "grad_norm": 0.7059140801429749, + "learning_rate": 0.0001635652718453007, + "loss": 0.23651680946350098, + "mean_token_accuracy": 0.9208931416273117, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.3910588648949945, + "eval_loss": 0.6104469299316406, + "eval_mean_token_accuracy": 0.8486883893262508, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7612, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.982, + "step": 1680 + }, + { + "entropy": 0.3001101028174162, + "epoch": 4.229140722291407, + "grad_norm": 0.6787802577018738, + "learning_rate": 0.00016179886210406728, + "loss": 0.23130471706390382, + "mean_token_accuracy": 0.9233332790434361, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3794369170832079, + "eval_loss": 0.6182110905647278, + "eval_mean_token_accuracy": 0.8495433777570724, + "eval_num_tokens": 3967474.0, + "eval_runtime": 85.94, + "eval_samples_per_second": 16.0, + "eval_steps_per_second": 2.001, + "step": 1700 + }, + { + "entropy": 0.3031421799212694, + "epoch": 4.2789539227895395, + "grad_norm": 0.9732038378715515, + "learning_rate": 0.0001600177774318036, + "loss": 0.2359529733657837, + "mean_token_accuracy": 0.9217648565769195, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3923123094231583, + "eval_loss": 0.6057384610176086, + "eval_mean_token_accuracy": 0.8508818288182103, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7647, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.29365369994193313, + "epoch": 4.328767123287671, + "grad_norm": 0.7681498527526855, + "learning_rate": 0.0001582225549793541, + "loss": 0.2269371747970581, + "mean_token_accuracy": 0.9245341829955578, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.4011661055129628, + "eval_loss": 0.6144486665725708, + "eval_mean_token_accuracy": 0.8480324357054955, + "eval_num_tokens": 4062594.0, + "eval_runtime": 87.1306, + "eval_samples_per_second": 15.781, + "eval_steps_per_second": 1.974, + "step": 1740 + }, + { + "entropy": 0.29396994728595016, + "epoch": 4.378580323785803, + "grad_norm": 1.0001007318496704, + "learning_rate": 0.0001564137361613248, + "loss": 0.22777395248413085, + "mean_token_accuracy": 0.9262309700250626, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38518730195802314, + "eval_loss": 0.6202630400657654, + "eval_mean_token_accuracy": 0.8493869807137999, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6616, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.3096018506214023, + "epoch": 4.428393524283935, + "grad_norm": 1.0448365211486816, + "learning_rate": 0.00015459186649280024, + "loss": 0.23696351051330566, + "mean_token_accuracy": 0.9217322513461113, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.3946371126140273, + "eval_loss": 0.6079026460647583, + "eval_mean_token_accuracy": 0.8492515852978063, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6582, + "eval_samples_per_second": 15.867, + "eval_steps_per_second": 1.985, + "step": 1780 + }, + { + "entropy": 0.32619857545942066, + "epoch": 4.478206724782067, + "grad_norm": 0.7210651636123657, + "learning_rate": 0.00015275749542482337, + "loss": 0.24651215076446534, + "mean_token_accuracy": 0.9177676141262054, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.3947690814560236, + "eval_loss": 0.6065912246704102, + "eval_mean_token_accuracy": 0.8502957744653835, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.5959, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.986, + "step": 1800 + }, + { + "entropy": 0.3193941755220294, + "epoch": 4.5280199252802, + "grad_norm": 0.8281906843185425, + "learning_rate": 0.0001509111761786888, + "loss": 0.23936262130737304, + "mean_token_accuracy": 0.9201708927750587, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38704028864239537, + "eval_loss": 0.6006569266319275, + "eval_mean_token_accuracy": 0.8502406720505205, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.8059, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1820 + }, + { + "entropy": 0.3164879363030195, + "epoch": 4.577833125778331, + "grad_norm": 0.7892968654632568, + "learning_rate": 0.00014905346557909867, + "loss": 0.24541733264923096, + "mean_token_accuracy": 0.9175932116806507, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.38861122120951497, + "eval_loss": 0.6115967631340027, + "eval_mean_token_accuracy": 0.849471275196519, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.2946, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1840 + }, + { + "entropy": 0.3051785985007882, + "epoch": 4.627646326276463, + "grad_norm": 0.8109654188156128, + "learning_rate": 0.0001471849238862319, + "loss": 0.23433220386505127, + "mean_token_accuracy": 0.9206570319831371, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.37162452295076015, + "eval_loss": 0.6184061765670776, + "eval_mean_token_accuracy": 0.8501173268223918, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.6865, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1860 + }, + { + "entropy": 0.3168198253959417, + "epoch": 4.677459526774595, + "grad_norm": 0.9512342214584351, + "learning_rate": 0.0001453061146267775, + "loss": 0.23832404613494873, + "mean_token_accuracy": 0.9197044663131237, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3845940856912801, + "eval_loss": 0.606762707233429, + "eval_mean_token_accuracy": 0.8504838194957999, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.5175, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 1880 + }, + { + "entropy": 0.30791807882487776, + "epoch": 4.7272727272727275, + "grad_norm": 0.8123113512992859, + "learning_rate": 0.00014341760442398248, + "loss": 0.2395785331726074, + "mean_token_accuracy": 0.918928150832653, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.39762327222283494, + "eval_loss": 0.5994202494621277, + "eval_mean_token_accuracy": 0.8509274201337681, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.2873, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.993, + "step": 1900 + }, + { + "entropy": 0.3021434534341097, + "epoch": 4.777085927770859, + "grad_norm": 0.731787383556366, + "learning_rate": 0.000141519962826766, + "loss": 0.23494718074798585, + "mean_token_accuracy": 0.9201403826475143, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.3827026732439219, + "eval_loss": 0.5995895862579346, + "eval_mean_token_accuracy": 0.851468373523202, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.3006, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 1920 + }, + { + "entropy": 0.31626159623265265, + "epoch": 4.826899128268991, + "grad_norm": 0.8848487138748169, + "learning_rate": 0.00013961376213795132, + "loss": 0.2439030647277832, + "mean_token_accuracy": 0.9196575872600079, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.388698436839636, + "eval_loss": 0.6000174283981323, + "eval_mean_token_accuracy": 0.8518068187458571, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.8979, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.979, + "step": 1940 + }, + { + "entropy": 0.30520407035946845, + "epoch": 4.876712328767123, + "grad_norm": 0.8532460927963257, + "learning_rate": 0.00013769957724166695, + "loss": 0.23458616733551024, + "mean_token_accuracy": 0.9221912942826748, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.38777847102908203, + "eval_loss": 0.6004981398582458, + "eval_mean_token_accuracy": 0.8516481768253238, + "eval_num_tokens": 4578167.0, + "eval_runtime": 87.0777, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.975, + "step": 1960 + }, + { + "entropy": 0.3226448342204094, + "epoch": 4.926525529265255, + "grad_norm": 0.6945561766624451, + "learning_rate": 0.0001357779854299694, + "loss": 0.24048397541046143, + "mean_token_accuracy": 0.9195300146937371, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.38581624263247777, + "eval_loss": 0.6029234528541565, + "eval_mean_token_accuracy": 0.8514213260523108, + "eval_num_tokens": 4622316.0, + "eval_runtime": 85.8729, + "eval_samples_per_second": 16.012, + "eval_steps_per_second": 2.003, + "step": 1980 + }, + { + "entropy": 0.3051655298098922, + "epoch": 4.976338729763388, + "grad_norm": 0.7976452708244324, + "learning_rate": 0.00013384956622874001, + "loss": 0.23584742546081544, + "mean_token_accuracy": 0.9216851457953453, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.37913159246361533, + "eval_loss": 0.6057604551315308, + "eval_mean_token_accuracy": 0.8525801203971686, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.1145, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 2000 + }, + { + "entropy": 0.27438195240803254, + "epoch": 5.024906600249066, + "grad_norm": 0.6729586124420166, + "learning_rate": 0.0001319149012229075, + "loss": 0.19775952100753785, + "mean_token_accuracy": 0.9339428559327737, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.3448961910813354, + "eval_loss": 0.6750120520591736, + "eval_mean_token_accuracy": 0.8487970232963562, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.1169, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 2020 + }, + { + "entropy": 0.21423916313797237, + "epoch": 5.074719800747198, + "grad_norm": 0.6934391856193542, + "learning_rate": 0.00012997457388105022, + "loss": 0.1439570426940918, + "mean_token_accuracy": 0.9528236843645572, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.3570949243771475, + "eval_loss": 0.6465504169464111, + "eval_mean_token_accuracy": 0.8490785547467166, + "eval_num_tokens": 4763269.0, + "eval_runtime": 85.9574, + "eval_samples_per_second": 15.996, + "eval_steps_per_second": 2.001, + "step": 2040 + }, + { + "entropy": 0.20838565267622472, + "epoch": 5.12453300124533, + "grad_norm": 0.7286986112594604, + "learning_rate": 0.00012802916937942972, + "loss": 0.14467307329177856, + "mean_token_accuracy": 0.950994835793972, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.3452463157821533, + "eval_loss": 0.6705958843231201, + "eval_mean_token_accuracy": 0.8490352796953778, + "eval_num_tokens": 4809047.0, + "eval_runtime": 86.228, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 2060 + }, + { + "entropy": 0.20453082229942082, + "epoch": 5.174346201743462, + "grad_norm": 0.7515555620193481, + "learning_rate": 0.00012607927442550974, + "loss": 0.13732000589370727, + "mean_token_accuracy": 0.9537357829511166, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.32431264914745506, + "eval_loss": 0.6743043065071106, + "eval_mean_token_accuracy": 0.8504878629085629, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.5948, + "eval_samples_per_second": 15.879, + "eval_steps_per_second": 1.986, + "step": 2080 + }, + { + "entropy": 0.21812320686876774, + "epoch": 5.224159402241594, + "grad_norm": 0.9093465209007263, + "learning_rate": 0.0001241254770810132, + "loss": 0.14311420917510986, + "mean_token_accuracy": 0.9514068141579628, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.33086285835435225, + "eval_loss": 0.6676449179649353, + "eval_mean_token_accuracy": 0.8505287662495015, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 2100 + }, + { + "entropy": 0.2180163251236081, + "epoch": 5.273972602739726, + "grad_norm": 0.6703007221221924, + "learning_rate": 0.00012216836658457075, + "loss": 0.14803968667984008, + "mean_token_accuracy": 0.9521303348243236, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.33162341708707255, + "eval_loss": 0.6658875942230225, + "eval_mean_token_accuracy": 0.8500757605530495, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.6296, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 2120 + }, + { + "entropy": 0.22511130161583423, + "epoch": 5.323785803237858, + "grad_norm": 0.8078880906105042, + "learning_rate": 0.00012020853317401455, + "loss": 0.15228408575057983, + "mean_token_accuracy": 0.947144789993763, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3354601170434508, + "eval_loss": 0.6677829623222351, + "eval_mean_token_accuracy": 0.8482600024273229, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.4689, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.989, + "step": 2140 + }, + { + "entropy": 0.2244176059961319, + "epoch": 5.37359900373599, + "grad_norm": 0.9636075496673584, + "learning_rate": 0.00011824656790837037, + "loss": 0.15260883569717407, + "mean_token_accuracy": 0.9471467643976211, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.3381616926297199, + "eval_loss": 0.6694412231445312, + "eval_mean_token_accuracy": 0.8482369603805764, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.4147, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 2160 + }, + { + "entropy": 0.22982364390045404, + "epoch": 5.423412204234122, + "grad_norm": 0.775401771068573, + "learning_rate": 0.00011628306248960262, + "loss": 0.15140302181243898, + "mean_token_accuracy": 0.9492553934454918, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.3305150235808173, + "eval_loss": 0.6717822551727295, + "eval_mean_token_accuracy": 0.8489849723355715, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.4728, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.989, + "step": 2180 + }, + { + "entropy": 0.21448935717344284, + "epoch": 5.473225404732254, + "grad_norm": 0.6575281023979187, + "learning_rate": 0.00011431860908416465, + "loss": 0.1452319622039795, + "mean_token_accuracy": 0.9505287684500218, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3488145174328671, + "eval_loss": 0.6612305641174316, + "eval_mean_token_accuracy": 0.8492907808963642, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6927, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 2200 + }, + { + "entropy": 0.23091202937066554, + "epoch": 5.523038605230386, + "grad_norm": 0.8909686207771301, + "learning_rate": 0.00011235380014440985, + "loss": 0.15150139331817628, + "mean_token_accuracy": 0.9497875183820724, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.3268539015810157, + "eval_loss": 0.6667542457580566, + "eval_mean_token_accuracy": 0.8499062903398691, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.4644, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 2220 + }, + { + "entropy": 0.2227974807843566, + "epoch": 5.572851805728518, + "grad_norm": 0.6180275082588196, + "learning_rate": 0.0001103892282299158, + "loss": 0.1491069197654724, + "mean_token_accuracy": 0.9488144010305405, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3346347655494546, + "eval_loss": 0.6665948629379272, + "eval_mean_token_accuracy": 0.8499961893918903, + "eval_num_tokens": 5226864.0, + "eval_runtime": 87.0548, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.976, + "step": 2240 + }, + { + "entropy": 0.21368421968072654, + "epoch": 5.62266500622665, + "grad_norm": 0.6004369258880615, + "learning_rate": 0.00010842548582877651, + "loss": 0.14485255479812623, + "mean_token_accuracy": 0.9502056457102299, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.32753298804163933, + "eval_loss": 0.6680151224136353, + "eval_mean_token_accuracy": 0.8515451086121936, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.8524, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.98, + "step": 2260 + }, + { + "entropy": 0.2103635374456644, + "epoch": 5.672478206724782, + "grad_norm": 0.699174702167511, + "learning_rate": 0.00010646316517891613, + "loss": 0.14297772645950318, + "mean_token_accuracy": 0.9512537539005279, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.32966585959806, + "eval_loss": 0.675578773021698, + "eval_mean_token_accuracy": 0.8509623023659684, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.4518, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.99, + "step": 2280 + }, + { + "entropy": 0.22516900151968003, + "epoch": 5.722291407222914, + "grad_norm": 0.6637354493141174, + "learning_rate": 0.00010450285808947797, + "loss": 0.15202572345733642, + "mean_token_accuracy": 0.9482452072203159, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3369456917740578, + "eval_loss": 0.6697061061859131, + "eval_mean_token_accuracy": 0.848603522361711, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.6371, + "eval_samples_per_second": 15.871, + "eval_steps_per_second": 1.985, + "step": 2300 + }, + { + "entropy": 0.21841065725311637, + "epoch": 5.772104607721046, + "grad_norm": 0.7940268516540527, + "learning_rate": 0.00010254515576234297, + "loss": 0.14710167646408082, + "mean_token_accuracy": 0.9493498183786869, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3237486180177955, + "eval_loss": 0.6779657602310181, + "eval_mean_token_accuracy": 0.8500715313955794, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.1826, + "eval_samples_per_second": 15.954, + "eval_steps_per_second": 1.996, + "step": 2320 + }, + { + "entropy": 0.22146204356104135, + "epoch": 5.821917808219178, + "grad_norm": 0.9234833121299744, + "learning_rate": 0.00010059064861383132, + "loss": 0.14720046520233154, + "mean_token_accuracy": 0.9493872679769992, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.32365207564692167, + "eval_loss": 0.6704005002975464, + "eval_mean_token_accuracy": 0.8507985760306203, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.5494, + "eval_samples_per_second": 15.887, + "eval_steps_per_second": 1.987, + "step": 2340 + }, + { + "entropy": 0.20934011954814197, + "epoch": 5.87173100871731, + "grad_norm": 0.5547503232955933, + "learning_rate": 9.863992609664084e-05, + "loss": 0.1464867353439331, + "mean_token_accuracy": 0.9503875687718392, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.3330401429083458, + "eval_loss": 0.6659091114997864, + "eval_mean_token_accuracy": 0.8504848906467127, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.5855, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 2360 + }, + { + "entropy": 0.21678635366261007, + "epoch": 5.921544209215442, + "grad_norm": 0.570612907409668, + "learning_rate": 9.669357652207635e-05, + "loss": 0.14821385145187377, + "mean_token_accuracy": 0.9503940217196941, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3322022325077722, + "eval_loss": 0.6722489595413208, + "eval_mean_token_accuracy": 0.8489979422369669, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.2986, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 2380 + }, + { + "entropy": 0.20932920072227718, + "epoch": 5.971357409713574, + "grad_norm": 0.7879557609558105, + "learning_rate": 9.475218688262262e-05, + "loss": 0.14675841331481934, + "mean_token_accuracy": 0.9507176131010056, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.3199348642902319, + "eval_loss": 0.6698136329650879, + "eval_mean_token_accuracy": 0.8514142130003419, + "eval_num_tokens": 5605400.0, + "eval_runtime": 85.8995, + "eval_samples_per_second": 16.007, + "eval_steps_per_second": 2.002, + "step": 2400 + }, + { + "entropy": 0.21032143919131693, + "epoch": 6.019925280199253, + "grad_norm": 0.5823076367378235, + "learning_rate": 9.281634267491569e-05, + "loss": 0.13322267532348633, + "mean_token_accuracy": 0.9550939072401096, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.30206270117399303, + "eval_loss": 0.7093168497085571, + "eval_mean_token_accuracy": 0.8500627639681794, + "eval_num_tokens": 5648968.0, + "eval_runtime": 85.8128, + "eval_samples_per_second": 16.023, + "eval_steps_per_second": 2.004, + "step": 2420 + }, + { + "entropy": 0.1534628233872354, + "epoch": 6.069738480697385, + "grad_norm": 0.710133969783783, + "learning_rate": 9.088662772316508e-05, + "loss": 0.09078952670097351, + "mean_token_accuracy": 0.9678447999060154, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.28208133101809857, + "eval_loss": 0.7636417150497437, + "eval_mean_token_accuracy": 0.8494061477655588, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9724, + "eval_samples_per_second": 15.994, + "eval_steps_per_second": 2.001, + "step": 2440 + }, + { + "entropy": 0.16151462448760867, + "epoch": 6.119551681195516, + "grad_norm": 0.5793812274932861, + "learning_rate": 8.896362400308028e-05, + "loss": 0.09545697569847107, + "mean_token_accuracy": 0.9671573750674725, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.2833245605403601, + "eval_loss": 0.7402405738830566, + "eval_mean_token_accuracy": 0.8503523728875226, + "eval_num_tokens": 5745090.0, + "eval_runtime": 85.5461, + "eval_samples_per_second": 16.073, + "eval_steps_per_second": 2.011, + "step": 2460 + }, + { + "entropy": 0.15203177919611335, + "epoch": 6.169364881693649, + "grad_norm": 0.4251123368740082, + "learning_rate": 8.704791146635483e-05, + "loss": 0.09420782327651978, + "mean_token_accuracy": 0.9677386932075024, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.28572545962971313, + "eval_loss": 0.735416829586029, + "eval_mean_token_accuracy": 0.8487084663884584, + "eval_num_tokens": 5790333.0, + "eval_runtime": 85.4801, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.012, + "step": 2480 + }, + { + "entropy": 0.15587336672469973, + "epoch": 6.219178082191781, + "grad_norm": 0.4357028007507324, + "learning_rate": 8.514006786576085e-05, + "loss": 0.09429320096969604, + "mean_token_accuracy": 0.9682952925562859, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.2859006894882335, + "eval_loss": 0.7347224950790405, + "eval_mean_token_accuracy": 0.8501905518215757, + "eval_num_tokens": 5837321.0, + "eval_runtime": 85.7578, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.006, + "step": 2500 + }, + { + "entropy": 0.15765639198943973, + "epoch": 6.268991282689913, + "grad_norm": 0.47331130504608154, + "learning_rate": 8.324066858090663e-05, + "loss": 0.09571113586425781, + "mean_token_accuracy": 0.9683481335639954, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.29231513846059176, + "eval_loss": 0.7392512559890747, + "eval_mean_token_accuracy": 0.8486633983462356, + "eval_num_tokens": 5884398.0, + "eval_runtime": 85.7846, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.005, + "step": 2520 + }, + { + "entropy": 0.16176860257983208, + "epoch": 6.318804483188045, + "grad_norm": 0.6142018437385559, + "learning_rate": 8.135028644470992e-05, + "loss": 0.09486144185066223, + "mean_token_accuracy": 0.9682316601276397, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.2851274753379267, + "eval_loss": 0.7520816922187805, + "eval_mean_token_accuracy": 0.8501113649717597, + "eval_num_tokens": 5929876.0, + "eval_runtime": 85.9425, + "eval_samples_per_second": 15.999, + "eval_steps_per_second": 2.001, + "step": 2540 + }, + { + "entropy": 0.15404034564271568, + "epoch": 6.3686176836861765, + "grad_norm": 0.6051287651062012, + "learning_rate": 7.946949157063964e-05, + "loss": 0.09280472993850708, + "mean_token_accuracy": 0.9684635892510414, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28802703563557114, + "eval_loss": 0.7439162135124207, + "eval_mean_token_accuracy": 0.8499851770872293, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.0703, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.998, + "step": 2560 + }, + { + "entropy": 0.15343588953837753, + "epoch": 6.418430884184309, + "grad_norm": 0.4823743402957916, + "learning_rate": 7.759885118077701e-05, + "loss": 0.09000591039657593, + "mean_token_accuracy": 0.9699928767979145, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2795634938533916, + "eval_loss": 0.7647850513458252, + "eval_mean_token_accuracy": 0.8503464397995971, + "eval_num_tokens": 6025380.0, + "eval_runtime": 85.8886, + "eval_samples_per_second": 16.009, + "eval_steps_per_second": 2.003, + "step": 2580 + }, + { + "entropy": 0.15740026142448188, + "epoch": 6.468244084682441, + "grad_norm": 0.5082696676254272, + "learning_rate": 7.57389294347494e-05, + "loss": 0.09191849827766418, + "mean_token_accuracy": 0.9692809768021107, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2913342311458532, + "eval_loss": 0.7518694996833801, + "eval_mean_token_accuracy": 0.8483168302580367, + "eval_num_tokens": 6073349.0, + "eval_runtime": 85.5761, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.01, + "step": 2600 + }, + { + "entropy": 0.15922069251537324, + "epoch": 6.518057285180573, + "grad_norm": 0.3995199501514435, + "learning_rate": 7.389028725958736e-05, + "loss": 0.09584367871284485, + "mean_token_accuracy": 0.9685114495456218, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.2863075934177221, + "eval_loss": 0.7539381384849548, + "eval_mean_token_accuracy": 0.8507507083027862, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.112, + "eval_samples_per_second": 15.968, + "eval_steps_per_second": 1.997, + "step": 2620 + }, + { + "entropy": 0.16197575423866512, + "epoch": 6.567870485678705, + "grad_norm": 0.534295380115509, + "learning_rate": 7.205348218055678e-05, + "loss": 0.0961170256137848, + "mean_token_accuracy": 0.9674530044198036, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.29021967315050057, + "eval_loss": 0.751198947429657, + "eval_mean_token_accuracy": 0.8509796344956686, + "eval_num_tokens": 6165523.0, + "eval_runtime": 85.7958, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.005, + "step": 2640 + }, + { + "entropy": 0.15261746793985367, + "epoch": 6.617683686176837, + "grad_norm": 0.5391237139701843, + "learning_rate": 7.022906815301673e-05, + "loss": 0.0926026999950409, + "mean_token_accuracy": 0.9695659473538398, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.29128045216202736, + "eval_loss": 0.7450292110443115, + "eval_mean_token_accuracy": 0.8498771443616512, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.3963, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 2660 + }, + { + "entropy": 0.16164180357009172, + "epoch": 6.667496886674969, + "grad_norm": 0.5767946243286133, + "learning_rate": 6.841759539535419e-05, + "loss": 0.09291981458663941, + "mean_token_accuracy": 0.9687136687338352, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2897637223088464, + "eval_loss": 0.7503410577774048, + "eval_mean_token_accuracy": 0.8503315164599308, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.0653, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.998, + "step": 2680 + }, + { + "entropy": 0.17062523355707526, + "epoch": 6.717310087173101, + "grad_norm": 0.4974168539047241, + "learning_rate": 6.661961022304563e-05, + "loss": 0.09713236689567566, + "mean_token_accuracy": 0.9661971725523472, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2765843396963075, + "eval_loss": 0.7604002356529236, + "eval_mean_token_accuracy": 0.8521115277395692, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.1676, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 2700 + }, + { + "entropy": 0.17544092936441302, + "epoch": 6.767123287671232, + "grad_norm": 0.5523537993431091, + "learning_rate": 6.483565488389582e-05, + "loss": 0.09709116220474243, + "mean_token_accuracy": 0.9650957375764847, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.27939334659035814, + "eval_loss": 0.7534670829772949, + "eval_mean_token_accuracy": 0.851230604010959, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.2913, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 2720 + }, + { + "entropy": 0.15991022661328316, + "epoch": 6.816936488169365, + "grad_norm": 0.478551983833313, + "learning_rate": 6.306626739450311e-05, + "loss": 0.09564646482467651, + "mean_token_accuracy": 0.9679084822535515, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.27878295491601146, + "eval_loss": 0.7519959211349487, + "eval_mean_token_accuracy": 0.8510654949864676, + "eval_num_tokens": 6397720.0, + "eval_runtime": 85.9109, + "eval_samples_per_second": 16.005, + "eval_steps_per_second": 2.002, + "step": 2740 + }, + { + "entropy": 0.16824879590421915, + "epoch": 6.866749688667497, + "grad_norm": 0.6681098937988281, + "learning_rate": 6.131198137800108e-05, + "loss": 0.0962279736995697, + "mean_token_accuracy": 0.966830012947321, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.2834690434121808, + "eval_loss": 0.751922070980072, + "eval_mean_token_accuracy": 0.8521237577809844, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.3618, + "eval_samples_per_second": 15.921, + "eval_steps_per_second": 1.992, + "step": 2760 + }, + { + "entropy": 0.1518704930320382, + "epoch": 6.916562889165629, + "grad_norm": 0.5201290249824524, + "learning_rate": 5.957332590312513e-05, + "loss": 0.09010660648345947, + "mean_token_accuracy": 0.9693463340401649, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.28485129617674404, + "eval_loss": 0.7452457547187805, + "eval_mean_token_accuracy": 0.8512036796919135, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.4524, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.99, + "step": 2780 + }, + { + "entropy": 0.15512610590085388, + "epoch": 6.966376089663761, + "grad_norm": 0.42802050709724426, + "learning_rate": 5.785082532465233e-05, + "loss": 0.09320432543754578, + "mean_token_accuracy": 0.9686134628951549, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.27554594526110693, + "eval_loss": 0.7644653916358948, + "eval_mean_token_accuracy": 0.8513738523389018, + "eval_num_tokens": 6540175.0, + "eval_runtime": 85.7609, + "eval_samples_per_second": 16.033, + "eval_steps_per_second": 2.006, + "step": 2800 + }, + { + "entropy": 0.17524497526196334, + "epoch": 7.01494396014944, + "grad_norm": 0.3330269157886505, + "learning_rate": 5.6144999125263545e-05, + "loss": 0.0895616888999939, + "mean_token_accuracy": 0.9682766932707566, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.2735865569218647, + "eval_loss": 0.768479585647583, + "eval_mean_token_accuracy": 0.8503459383581959, + "eval_num_tokens": 6583767.0, + "eval_runtime": 85.7162, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.007, + "step": 2820 + }, + { + "entropy": 0.1403565663844347, + "epoch": 7.064757160647572, + "grad_norm": 0.35613498091697693, + "learning_rate": 5.4456361758874235e-05, + "loss": 0.07551313638687134, + "mean_token_accuracy": 0.9739301167428493, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.25941789089593775, + "eval_loss": 0.8209511637687683, + "eval_mean_token_accuracy": 0.8505055855873019, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.0943, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 2840 + }, + { + "entropy": 0.13500106502324344, + "epoch": 7.114570361145703, + "grad_norm": 0.34418627619743347, + "learning_rate": 5.2785422495482234e-05, + "loss": 0.07293946146965027, + "mean_token_accuracy": 0.9747208289802074, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.26482899772912954, + "eval_loss": 0.798904538154602, + "eval_mean_token_accuracy": 0.8511530233677044, + "eval_num_tokens": 6672946.0, + "eval_runtime": 85.7915, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.005, + "step": 2860 + }, + { + "entropy": 0.13127502552233636, + "epoch": 7.164383561643835, + "grad_norm": 0.4638441503047943, + "learning_rate": 5.113268526757892e-05, + "loss": 0.07121461629867554, + "mean_token_accuracy": 0.9756786689162255, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2645381211714689, + "eval_loss": 0.809101939201355, + "eval_mean_token_accuracy": 0.8514727898115335, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.84, + "eval_samples_per_second": 16.018, + "eval_steps_per_second": 2.004, + "step": 2880 + }, + { + "entropy": 0.1331390908919275, + "epoch": 7.214196762141968, + "grad_norm": 0.40206775069236755, + "learning_rate": 4.949864851817007e-05, + "loss": 0.07188264131546021, + "mean_token_accuracy": 0.9755406074225903, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.26244733283339544, + "eval_loss": 0.8143188953399658, + "eval_mean_token_accuracy": 0.8514358189909957, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.8546, + "eval_samples_per_second": 16.015, + "eval_steps_per_second": 2.003, + "step": 2900 + }, + { + "entropy": 0.13647331558167936, + "epoch": 7.2640099626401, + "grad_norm": 0.26405787467956543, + "learning_rate": 4.788380505045224e-05, + "loss": 0.07412450313568116, + "mean_token_accuracy": 0.9744274213910102, + "num_tokens": 6809678.0, + "step": 2920 + }, + { + "epoch": 7.2640099626401, + "eval_entropy": 0.2626111418182074, + "eval_loss": 0.8111525177955627, + "eval_mean_token_accuracy": 0.8512121695418691, + "eval_num_tokens": 6809678.0, + "eval_runtime": 85.9626, + "eval_samples_per_second": 15.995, + "eval_steps_per_second": 2.001, + "step": 2920 + }, + { + "entropy": 0.12644002586603165, + "epoch": 7.313823163138232, + "grad_norm": 0.27514681220054626, + "learning_rate": 4.6288641879189884e-05, + "loss": 0.06807711124420165, + "mean_token_accuracy": 0.9760703906416893, + "num_tokens": 6860750.0, + "step": 2940 + }, + { + "epoch": 7.313823163138232, + "eval_entropy": 0.26096762734097106, + "eval_loss": 0.8184595108032227, + "eval_mean_token_accuracy": 0.8501476153384807, + "eval_num_tokens": 6860750.0, + "eval_runtime": 85.9521, + "eval_samples_per_second": 15.997, + "eval_steps_per_second": 2.001, + "step": 2940 + }, + { + "entropy": 0.13920630998909472, + "epoch": 7.363636363636363, + "grad_norm": 0.23584705591201782, + "learning_rate": 4.4713640083838604e-05, + "loss": 0.07301607131958007, + "mean_token_accuracy": 0.9745715200901032, + "num_tokens": 6907092.0, + "step": 2960 + }, + { + "epoch": 7.363636363636363, + "eval_entropy": 0.2612536767021168, + "eval_loss": 0.8116245269775391, + "eval_mean_token_accuracy": 0.8510967350976412, + "eval_num_tokens": 6907092.0, + "eval_runtime": 85.6373, + "eval_samples_per_second": 16.056, + "eval_steps_per_second": 2.008, + "step": 2960 + }, + { + "entropy": 0.1349492883309722, + "epoch": 7.4134495641344955, + "grad_norm": 0.24552719295024872, + "learning_rate": 4.315927466345791e-05, + "loss": 0.07397544980049134, + "mean_token_accuracy": 0.9745095103979111, + "num_tokens": 6952700.0, + "step": 2980 + }, + { + "epoch": 7.4134495641344955, + "eval_entropy": 0.25796533306670744, + "eval_loss": 0.8266491293907166, + "eval_mean_token_accuracy": 0.8511653857868772, + "eval_num_tokens": 6952700.0, + "eval_runtime": 85.7462, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.006, + "step": 2980 + }, + { + "entropy": 0.14479175000451505, + "epoch": 7.463262764632628, + "grad_norm": 0.2846072018146515, + "learning_rate": 4.162601439345814e-05, + "loss": 0.07544798254966736, + "mean_token_accuracy": 0.9727819666266442, + "num_tokens": 6996430.0, + "step": 3000 + }, + { + "epoch": 7.463262764632628, + "eval_entropy": 0.2584348309698493, + "eval_loss": 0.8253348469734192, + "eval_mean_token_accuracy": 0.8511569815319638, + "eval_num_tokens": 6996430.0, + "eval_runtime": 86.2984, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 3000 + }, + { + "entropy": 0.14114196319133043, + "epoch": 7.51307596513076, + "grad_norm": 0.407966285943985, + "learning_rate": 4.011432168422419e-05, + "loss": 0.0736398994922638, + "mean_token_accuracy": 0.9741654269397259, + "num_tokens": 7042038.0, + "step": 3020 + }, + { + "epoch": 7.51307596513076, + "eval_entropy": 0.25232676260693127, + "eval_loss": 0.8296052813529968, + "eval_mean_token_accuracy": 0.8523298349491385, + "eval_num_tokens": 7042038.0, + "eval_runtime": 85.8445, + "eval_samples_per_second": 16.017, + "eval_steps_per_second": 2.004, + "step": 3020 + }, + { + "entropy": 0.1353456223383546, + "epoch": 7.562889165628892, + "grad_norm": 0.2712634801864624, + "learning_rate": 3.8624652441658684e-05, + "loss": 0.07362412214279175, + "mean_token_accuracy": 0.9747945807874203, + "num_tokens": 7089390.0, + "step": 3040 + }, + { + "epoch": 7.562889165628892, + "eval_entropy": 0.2579477243991785, + "eval_loss": 0.8274564743041992, + "eval_mean_token_accuracy": 0.8517705212498821, + "eval_num_tokens": 7089390.0, + "eval_runtime": 85.8222, + "eval_samples_per_second": 16.022, + "eval_steps_per_second": 2.004, + "step": 3040 + }, + { + "entropy": 0.1296080862637609, + "epoch": 7.6127023661270234, + "grad_norm": 0.2371893972158432, + "learning_rate": 3.715745592968707e-05, + "loss": 0.06971035599708557, + "mean_token_accuracy": 0.9759043246507645, + "num_tokens": 7138002.0, + "step": 3060 + }, + { + "epoch": 7.6127023661270234, + "eval_entropy": 0.25391967083479083, + "eval_loss": 0.8197130560874939, + "eval_mean_token_accuracy": 0.8522267875283264, + "eval_num_tokens": 7138002.0, + "eval_runtime": 85.8796, + "eval_samples_per_second": 16.011, + "eval_steps_per_second": 2.003, + "step": 3060 + }, + { + "entropy": 0.1311203008517623, + "epoch": 7.662515566625156, + "grad_norm": 0.22499267756938934, + "learning_rate": 3.5713174634765967e-05, + "loss": 0.07176244258880615, + "mean_token_accuracy": 0.9754939571022987, + "num_tokens": 7185520.0, + "step": 3080 + }, + { + "epoch": 7.662515566625156, + "eval_entropy": 0.2526215241225653, + "eval_loss": 0.8265154361724854, + "eval_mean_token_accuracy": 0.8519952584837758, + "eval_num_tokens": 7185520.0, + "eval_runtime": 85.8746, + "eval_samples_per_second": 16.012, + "eval_steps_per_second": 2.003, + "step": 3080 + }, + { + "entropy": 0.13420484317466616, + "epoch": 7.712328767123288, + "grad_norm": 0.2398064285516739, + "learning_rate": 3.4292244132434866e-05, + "loss": 0.07559212446212768, + "mean_token_accuracy": 0.9743142127990723, + "num_tokens": 7232170.0, + "step": 3100 + }, + { + "epoch": 7.712328767123288, + "eval_entropy": 0.2484562756537005, + "eval_loss": 0.8312150239944458, + "eval_mean_token_accuracy": 0.8528405119513356, + "eval_num_tokens": 7232170.0, + "eval_runtime": 85.7896, + "eval_samples_per_second": 16.028, + "eval_steps_per_second": 2.005, + "step": 3100 + }, + { + "entropy": 0.11965563679113984, + "epoch": 7.76214196762142, + "grad_norm": 0.3408384919166565, + "learning_rate": 3.2895092955952746e-05, + "loss": 0.0661750853061676, + "mean_token_accuracy": 0.9776600524783134, + "num_tokens": 7282846.0, + "step": 3120 + }, + { + "epoch": 7.76214196762142, + "eval_entropy": 0.2522421533804993, + "eval_loss": 0.8327009677886963, + "eval_mean_token_accuracy": 0.8524222023958383, + "eval_num_tokens": 7282846.0, + "eval_runtime": 86.1769, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 1.996, + "step": 3120 + }, + { + "entropy": 0.13388084415346385, + "epoch": 7.811955168119551, + "grad_norm": 0.35418516397476196, + "learning_rate": 3.152214246705829e-05, + "loss": 0.07149899601936341, + "mean_token_accuracy": 0.9747635535895824, + "num_tokens": 7331518.0, + "step": 3140 + }, + { + "epoch": 7.811955168119551, + "eval_entropy": 0.25038352296795957, + "eval_loss": 0.836457371711731, + "eval_mean_token_accuracy": 0.8526130665180295, + "eval_num_tokens": 7331518.0, + "eval_runtime": 85.6099, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.009, + "step": 3140 + }, + { + "entropy": 0.13530643959529698, + "epoch": 7.861768368617684, + "grad_norm": 0.38060539960861206, + "learning_rate": 3.017380672889291e-05, + "loss": 0.07116585969924927, + "mean_token_accuracy": 0.973284512758255, + "num_tokens": 7379056.0, + "step": 3160 + }, + { + "epoch": 7.861768368617684, + "eval_entropy": 0.255092611319797, + "eval_loss": 0.8314701914787292, + "eval_mean_token_accuracy": 0.8520913099826768, + "eval_num_tokens": 7379056.0, + "eval_runtime": 85.877, + "eval_samples_per_second": 16.011, + "eval_steps_per_second": 2.003, + "step": 3160 + }, + { + "entropy": 0.13383390177041293, + "epoch": 7.911581569115816, + "grad_norm": 0.3827536106109619, + "learning_rate": 2.8850492381124808e-05, + "loss": 0.07305437326431274, + "mean_token_accuracy": 0.9750778004527092, + "num_tokens": 7424770.0, + "step": 3180 + }, + { + "epoch": 7.911581569115816, + "eval_entropy": 0.25416371157003004, + "eval_loss": 0.8206402063369751, + "eval_mean_token_accuracy": 0.852779901651449, + "eval_num_tokens": 7424770.0, + "eval_runtime": 86.1015, + "eval_samples_per_second": 15.97, + "eval_steps_per_second": 1.998, + "step": 3180 + }, + { + "entropy": 0.1395680439658463, + "epoch": 7.961394769613948, + "grad_norm": 0.3809775412082672, + "learning_rate": 2.7552598517312256e-05, + "loss": 0.07236042022705078, + "mean_token_accuracy": 0.9731538116931915, + "num_tokens": 7470804.0, + "step": 3200 + }, + { + "epoch": 7.961394769613948, + "eval_entropy": 0.25528111975899964, + "eval_loss": 0.8230037093162537, + "eval_mean_token_accuracy": 0.8526452603035195, + "eval_num_tokens": 7470804.0, + "eval_runtime": 85.7895, + "eval_samples_per_second": 16.028, + "eval_steps_per_second": 2.005, + "step": 3200 + }, + { + "entropy": 0.12193699864049752, + "epoch": 8.009962640099626, + "grad_norm": 0.11854425817728043, + "learning_rate": 2.6280516564542205e-05, + "loss": 0.06617764234542847, + "mean_token_accuracy": 0.977179691577569, + "num_tokens": 7518110.0, + "step": 3220 + }, + { + "epoch": 8.009962640099626, + "eval_entropy": 0.25100527677771656, + "eval_loss": 0.8393343687057495, + "eval_mean_token_accuracy": 0.8522553132023922, + "eval_num_tokens": 7518110.0, + "eval_runtime": 85.8837, + "eval_samples_per_second": 16.01, + "eval_steps_per_second": 2.003, + "step": 3220 + }, + { + "entropy": 0.12788885813206435, + "epoch": 8.059775840597759, + "grad_norm": 0.16094881296157837, + "learning_rate": 2.50346301653812e-05, + "loss": 0.06274186968803405, + "mean_token_accuracy": 0.9766994707286358, + "num_tokens": 7565539.0, + "step": 3240 + }, + { + "epoch": 8.059775840597759, + "eval_entropy": 0.24409458682287571, + "eval_loss": 0.874617338180542, + "eval_mean_token_accuracy": 0.8521041180505309, + "eval_num_tokens": 7565539.0, + "eval_runtime": 86.2656, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 3240 + }, + { + "entropy": 0.12464155335910618, + "epoch": 8.10958904109589, + "grad_norm": 0.16893954575061798, + "learning_rate": 2.381531506217437e-05, + "loss": 0.06093020439147949, + "mean_token_accuracy": 0.9776258453726768, + "num_tokens": 7612578.0, + "step": 3260 + }, + { + "epoch": 8.10958904109589, + "eval_entropy": 0.24396493017326953, + "eval_loss": 0.891161322593689, + "eval_mean_token_accuracy": 0.8515338024427724, + "eval_num_tokens": 7612578.0, + "eval_runtime": 85.9061, + "eval_samples_per_second": 16.006, + "eval_steps_per_second": 2.002, + "step": 3260 + }, + { + "entropy": 0.12345920228399336, + "epoch": 8.159402241594023, + "grad_norm": 0.14332273602485657, + "learning_rate": 2.262293898372616e-05, + "loss": 0.061289966106414795, + "mean_token_accuracy": 0.9762230902910233, + "num_tokens": 7660157.0, + "step": 3280 + }, + { + "epoch": 8.159402241594023, + "eval_entropy": 0.2481445314059424, + "eval_loss": 0.8922848105430603, + "eval_mean_token_accuracy": 0.8514944855556932, + "eval_num_tokens": 7660157.0, + "eval_runtime": 85.5201, + "eval_samples_per_second": 16.078, + "eval_steps_per_second": 2.011, + "step": 3280 + }, + { + "entropy": 0.12298110066913068, + "epoch": 8.209215442092155, + "grad_norm": 0.21848882734775543, + "learning_rate": 2.1457861534398633e-05, + "loss": 0.05986443758010864, + "mean_token_accuracy": 0.9786281704902648, + "num_tokens": 7709745.0, + "step": 3300 + }, + { + "epoch": 8.209215442092155, + "eval_entropy": 0.24329388124305149, + "eval_loss": 0.9021085500717163, + "eval_mean_token_accuracy": 0.8521762625422589, + "eval_num_tokens": 7709745.0, + "eval_runtime": 85.955, + "eval_samples_per_second": 15.997, + "eval_steps_per_second": 2.001, + "step": 3300 + }, + { + "entropy": 0.13265180448070168, + "epoch": 8.259028642590286, + "grad_norm": 0.18067947030067444, + "learning_rate": 2.0320434085659692e-05, + "loss": 0.06724961400032044, + "mean_token_accuracy": 0.975098168104887, + "num_tokens": 7753571.0, + "step": 3320 + }, + { + "epoch": 8.259028642590286, + "eval_entropy": 0.2433211464694766, + "eval_loss": 0.9094350337982178, + "eval_mean_token_accuracy": 0.8520150094531304, + "eval_num_tokens": 7753571.0, + "eval_runtime": 85.7989, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.005, + "step": 3320 + }, + { + "entropy": 0.11949320202693343, + "epoch": 8.308841843088418, + "grad_norm": 0.17020289599895477, + "learning_rate": 1.9210999670114196e-05, + "loss": 0.0634455680847168, + "mean_token_accuracy": 0.9771294385194779, + "num_tokens": 7799310.0, + "step": 3340 + }, + { + "epoch": 8.308841843088418, + "eval_entropy": 0.24345201219237128, + "eval_loss": 0.9021793603897095, + "eval_mean_token_accuracy": 0.8520745697409607, + "eval_num_tokens": 7799310.0, + "eval_runtime": 86.0883, + "eval_samples_per_second": 15.972, + "eval_steps_per_second": 1.998, + "step": 3340 + }, + { + "entropy": 0.12065747743472457, + "epoch": 8.35865504358655, + "grad_norm": 0.16789060831069946, + "learning_rate": 1.8129892878049886e-05, + "loss": 0.061494195461273195, + "mean_token_accuracy": 0.9779584899544715, + "num_tokens": 7846447.0, + "step": 3360 + }, + { + "epoch": 8.35865504358655, + "eval_entropy": 0.24093415042342142, + "eval_loss": 0.9006755352020264, + "eval_mean_token_accuracy": 0.852174230786257, + "eval_num_tokens": 7846447.0, + "eval_runtime": 85.9011, + "eval_samples_per_second": 16.007, + "eval_steps_per_second": 2.002, + "step": 3360 + }, + { + "entropy": 0.13125578537583352, + "epoch": 8.408468244084682, + "grad_norm": 0.1662452220916748, + "learning_rate": 1.70774397565298e-05, + "loss": 0.06685600876808166, + "mean_token_accuracy": 0.9744067586958408, + "num_tokens": 7890283.0, + "step": 3380 + }, + { + "epoch": 8.408468244084682, + "eval_entropy": 0.24062153688350388, + "eval_loss": 0.9078915119171143, + "eval_mean_token_accuracy": 0.8523201647886011, + "eval_num_tokens": 7890283.0, + "eval_runtime": 86.0201, + "eval_samples_per_second": 15.985, + "eval_steps_per_second": 2.0, + "step": 3380 + }, + { + "entropy": 0.11986117120832204, + "epoch": 8.458281444582815, + "grad_norm": 0.19571948051452637, + "learning_rate": 1.6053957711060606e-05, + "loss": 0.06411095261573792, + "mean_token_accuracy": 0.9770627245306969, + "num_tokens": 7936518.0, + "step": 3400 + }, + { + "epoch": 8.458281444582815, + "eval_entropy": 0.24352820347561394, + "eval_loss": 0.9058943390846252, + "eval_mean_token_accuracy": 0.8519382792156797, + "eval_num_tokens": 7936518.0, + "eval_runtime": 85.966, + "eval_samples_per_second": 15.995, + "eval_steps_per_second": 2.001, + "step": 3400 + }, + { + "entropy": 0.12857897616922856, + "epoch": 8.508094645080947, + "grad_norm": 0.2609264850616455, + "learning_rate": 1.5059755409867613e-05, + "loss": 0.06473397612571716, + "mean_token_accuracy": 0.9764650195837021, + "num_tokens": 7981966.0, + "step": 3420 + }, + { + "epoch": 8.508094645080947, + "eval_entropy": 0.24032609000108962, + "eval_loss": 0.9077776074409485, + "eval_mean_token_accuracy": 0.8517829197090726, + "eval_num_tokens": 7981966.0, + "eval_runtime": 86.6059, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 3420 + }, + { + "entropy": 0.12348870886489749, + "epoch": 8.557907845579079, + "grad_norm": 0.19537609815597534, + "learning_rate": 1.409513269080473e-05, + "loss": 0.06481348872184753, + "mean_token_accuracy": 0.9769559659063816, + "num_tokens": 8028367.0, + "step": 3440 + }, + { + "epoch": 8.557907845579079, + "eval_entropy": 0.2404322574824788, + "eval_loss": 0.9057720899581909, + "eval_mean_token_accuracy": 0.8521037981953732, + "eval_num_tokens": 8028367.0, + "eval_runtime": 86.166, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.996, + "step": 3440 + }, + { + "entropy": 0.12040232736617326, + "epoch": 8.607721046077211, + "grad_norm": 0.3310582935810089, + "learning_rate": 1.3160380470927183e-05, + "loss": 0.06468871235847473, + "mean_token_accuracy": 0.9768650442361831, + "num_tokens": 8074934.0, + "step": 3460 + }, + { + "epoch": 8.607721046077211, + "eval_entropy": 0.24118655876711356, + "eval_loss": 0.9028318524360657, + "eval_mean_token_accuracy": 0.8521025340224422, + "eval_num_tokens": 8074934.0, + "eval_runtime": 85.3668, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.015, + "step": 3460 + }, + { + "entropy": 0.12328103906475008, + "epoch": 8.657534246575342, + "grad_norm": 0.12836167216300964, + "learning_rate": 1.2255780658755122e-05, + "loss": 0.06229386329650879, + "mean_token_accuracy": 0.9763277888298034, + "num_tokens": 8122775.0, + "step": 3480 + }, + { + "epoch": 8.657534246575342, + "eval_entropy": 0.24194598145956217, + "eval_loss": 0.9009329080581665, + "eval_mean_token_accuracy": 0.8521693289973015, + "eval_num_tokens": 8122775.0, + "eval_runtime": 85.9415, + "eval_samples_per_second": 15.999, + "eval_steps_per_second": 2.001, + "step": 3480 + }, + { + "entropy": 0.11321646976284683, + "epoch": 8.707347447073474, + "grad_norm": 0.15656894445419312, + "learning_rate": 1.1381606069253786e-05, + "loss": 0.05908188819885254, + "mean_token_accuracy": 0.9779504477977753, + "num_tokens": 8174307.0, + "step": 3500 + }, + { + "epoch": 8.707347447073474, + "eval_entropy": 0.24121542517528977, + "eval_loss": 0.9016091823577881, + "eval_mean_token_accuracy": 0.8521790667328724, + "eval_num_tokens": 8174307.0, + "eval_runtime": 85.7465, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.006, + "step": 3500 + }, + { + "entropy": 0.12657046681270004, + "epoch": 8.757160647571606, + "grad_norm": 0.22597502171993256, + "learning_rate": 1.053812034155629e-05, + "loss": 0.06244581937789917, + "mean_token_accuracy": 0.976795207709074, + "num_tokens": 8222808.0, + "step": 3520 + }, + { + "epoch": 8.757160647571606, + "eval_entropy": 0.23877542708502258, + "eval_loss": 0.9069110155105591, + "eval_mean_token_accuracy": 0.8522880177858264, + "eval_num_tokens": 8222808.0, + "eval_runtime": 85.7792, + "eval_samples_per_second": 16.03, + "eval_steps_per_second": 2.005, + "step": 3520 + }, + { + "entropy": 0.11422101808711886, + "epoch": 8.806973848069738, + "grad_norm": 0.21139323711395264, + "learning_rate": 9.725577859453502e-06, + "loss": 0.05988085865974426, + "mean_token_accuracy": 0.9779510758817196, + "num_tokens": 8273335.0, + "step": 3540 + }, + { + "epoch": 8.806973848069738, + "eval_entropy": 0.2393161087881687, + "eval_loss": 0.9033801555633545, + "eval_mean_token_accuracy": 0.8522614209457885, + "eval_num_tokens": 8273335.0, + "eval_runtime": 85.5594, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 3540 + }, + { + "entropy": 0.13810604228638113, + "epoch": 8.85678704856787, + "grad_norm": 0.24571993947029114, + "learning_rate": 8.944223674675537e-06, + "loss": 0.07036117911338806, + "mean_token_accuracy": 0.9734892748296261, + "num_tokens": 8315235.0, + "step": 3560 + }, + { + "epoch": 8.85678704856787, + "eval_entropy": 0.23998506947658782, + "eval_loss": 0.9009848833084106, + "eval_mean_token_accuracy": 0.8521793619837872, + "eval_num_tokens": 8315235.0, + "eval_runtime": 86.0974, + "eval_samples_per_second": 15.97, + "eval_steps_per_second": 1.998, + "step": 3560 + }, + { + "entropy": 0.14193559321574867, + "epoch": 8.906600249066003, + "grad_norm": 0.17304112017154694, + "learning_rate": 8.194293432987386e-06, + "loss": 0.07077967524528503, + "mean_token_accuracy": 0.973305893689394, + "num_tokens": 8358099.0, + "step": 3580 + }, + { + "epoch": 8.906600249066003, + "eval_entropy": 0.23883876689644748, + "eval_loss": 0.9015622138977051, + "eval_mean_token_accuracy": 0.8524864378363587, + "eval_num_tokens": 8358099.0, + "eval_runtime": 86.0089, + "eval_samples_per_second": 15.987, + "eval_steps_per_second": 2.0, + "step": 3580 + }, + { + "entropy": 0.11878943420015275, + "epoch": 8.956413449564135, + "grad_norm": 0.19075658917427063, + "learning_rate": 7.476013303121426e-06, + "loss": 0.060806107521057126, + "mean_token_accuracy": 0.9776863709092141, + "num_tokens": 8407430.0, + "step": 3600 + }, + { + "epoch": 8.956413449564135, + "eval_entropy": 0.23726526309931, + "eval_loss": 0.9060276746749878, + "eval_mean_token_accuracy": 0.8524192058762838, + "eval_num_tokens": 8407430.0, + "eval_runtime": 85.7252, + "eval_samples_per_second": 16.04, + "eval_steps_per_second": 2.006, + "step": 3600 + }, + { + "entropy": 0.1255835090787747, + "epoch": 9.004981320049813, + "grad_norm": 0.11608047038316727, + "learning_rate": 6.78959990856799e-06, + "loss": 0.06319612860679627, + "mean_token_accuracy": 0.9766685519462976, + "num_tokens": 8453175.0, + "step": 3620 + }, + { + "epoch": 9.004981320049813, + "eval_entropy": 0.2373251837006835, + "eval_loss": 0.9045722484588623, + "eval_mean_token_accuracy": 0.8525558363559634, + "eval_num_tokens": 8453175.0, + "eval_runtime": 85.7435, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.006, + "step": 3620 + }, + { + "entropy": 0.12587778437882663, + "epoch": 9.054794520547945, + "grad_norm": 0.1564614623785019, + "learning_rate": 6.135260262244683e-06, + "loss": 0.0630365788936615, + "mean_token_accuracy": 0.9777486085891723, + "num_tokens": 8497151.0, + "step": 3640 + }, + { + "epoch": 9.054794520547945, + "eval_entropy": 0.23559923721260803, + "eval_loss": 0.9120694398880005, + "eval_mean_token_accuracy": 0.8525292966947999, + "eval_num_tokens": 8497151.0, + "eval_runtime": 85.8018, + "eval_samples_per_second": 16.025, + "eval_steps_per_second": 2.005, + "step": 3640 + }, + { + "entropy": 0.12535365503281354, + "epoch": 9.104607721046078, + "grad_norm": 0.1404249221086502, + "learning_rate": 5.513191704064086e-06, + "loss": 0.060502654314041136, + "mean_token_accuracy": 0.9770058333873749, + "num_tokens": 8542996.0, + "step": 3660 + }, + { + "epoch": 9.104607721046078, + "eval_entropy": 0.23525122691725575, + "eval_loss": 0.9182237982749939, + "eval_mean_token_accuracy": 0.8524098333924316, + "eval_num_tokens": 8542996.0, + "eval_runtime": 85.9872, + "eval_samples_per_second": 15.991, + "eval_steps_per_second": 2.0, + "step": 3660 + }, + { + "entropy": 0.11330419047735632, + "epoch": 9.15442092154421, + "grad_norm": 0.15513843297958374, + "learning_rate": 4.92358184141876e-06, + "loss": 0.05822383761405945, + "mean_token_accuracy": 0.9793384782969952, + "num_tokens": 8591625.0, + "step": 3680 + }, + { + "epoch": 9.15442092154421, + "eval_entropy": 0.2353947116711805, + "eval_loss": 0.9229223132133484, + "eval_mean_token_accuracy": 0.852500357253607, + "eval_num_tokens": 8591625.0, + "eval_runtime": 86.0805, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.998, + "step": 3680 + }, + { + "entropy": 0.11830627010203898, + "epoch": 9.204234122042342, + "grad_norm": 0.1730550080537796, + "learning_rate": 4.366608492601456e-06, + "loss": 0.05860854983329773, + "mean_token_accuracy": 0.9779663667082786, + "num_tokens": 8639845.0, + "step": 3700 + }, + { + "epoch": 9.204234122042342, + "eval_entropy": 0.23567205719476522, + "eval_loss": 0.9269373416900635, + "eval_mean_token_accuracy": 0.8523658004611038, + "eval_num_tokens": 8639845.0, + "eval_runtime": 85.9809, + "eval_samples_per_second": 15.992, + "eval_steps_per_second": 2.0, + "step": 3700 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.6481290013573325e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3720/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3720/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3720/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3720/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3720/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3720/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3720/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3720/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3720/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3720/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3720/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3720/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3720/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3720/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..c6b1859f856f3191883f30ec802c9b60213392d3 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3720/trainer_state.json @@ -0,0 +1,3940 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 9.254047322540472, + "eval_steps": 20, + "global_step": 3720, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + }, + { + "entropy": 0.561330484598875, + "epoch": 1.891656288916563, + "grad_norm": 0.6722865700721741, + "learning_rate": 0.0002208867897174789, + "loss": 0.499837589263916, + "mean_token_accuracy": 0.8518734864890576, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.5865232653396074, + "eval_loss": 0.5437926650047302, + "eval_mean_token_accuracy": 0.8450997017843779, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4116, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.547389242425561, + "epoch": 1.9414694894146949, + "grad_norm": 0.7935577034950256, + "learning_rate": 0.00022027119820226907, + "loss": 0.4977591514587402, + "mean_token_accuracy": 0.8539491161704064, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.5290903090391048, + "eval_loss": 0.5409526824951172, + "eval_mean_token_accuracy": 0.8497545698354411, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.7262, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 780 + }, + { + "entropy": 0.5687909748405218, + "epoch": 1.9912826899128269, + "grad_norm": 0.6180546283721924, + "learning_rate": 0.00021962329729698345, + "loss": 0.5109643459320068, + "mean_token_accuracy": 0.8521598495543004, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.5503541858390321, + "eval_loss": 0.5361555218696594, + "eval_mean_token_accuracy": 0.8510884285666221, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.3339, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 800 + }, + { + "entropy": 0.4739728841261986, + "epoch": 2.0398505603985058, + "grad_norm": 0.8058829307556152, + "learning_rate": 0.0002189432823996982, + "loss": 0.4204097747802734, + "mean_token_accuracy": 0.8728981889211215, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.5077334992414297, + "eval_loss": 0.5531114339828491, + "eval_mean_token_accuracy": 0.8489257208136625, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.4801, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.989, + "step": 820 + }, + { + "entropy": 0.4594309840351343, + "epoch": 2.0896637608966375, + "grad_norm": 0.6906896829605103, + "learning_rate": 0.0002182313585936314, + "loss": 0.4071959495544434, + "mean_token_accuracy": 0.8732857562601566, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.49850136994622474, + "eval_loss": 0.5486204624176025, + "eval_mean_token_accuracy": 0.8507991450470548, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.3364, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.4881629109382629, + "epoch": 2.1394769613947697, + "grad_norm": 0.6343470215797424, + "learning_rate": 0.0002174877405852928, + "loss": 0.41669540405273436, + "mean_token_accuracy": 0.8711295068264008, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.49155513924914734, + "eval_loss": 0.555109441280365, + "eval_mean_token_accuracy": 0.8496399400539176, + "eval_num_tokens": 2008562.0, + "eval_runtime": 86.3295, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 860 + }, + { + "entropy": 0.4648668970912695, + "epoch": 2.1892901618929015, + "grad_norm": 0.8014165163040161, + "learning_rate": 0.00021671265263973133, + "loss": 0.4110250473022461, + "mean_token_accuracy": 0.8754166305065155, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.4909258722219356, + "eval_loss": 0.5539511442184448, + "eval_mean_token_accuracy": 0.8492401502160138, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.3468, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 880 + }, + { + "entropy": 0.4824485514312983, + "epoch": 2.2391033623910337, + "grad_norm": 0.6665191054344177, + "learning_rate": 0.00021590632851289967, + "loss": 0.4181404113769531, + "mean_token_accuracy": 0.8726993151009083, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.4986876940657926, + "eval_loss": 0.547695517539978, + "eval_mean_token_accuracy": 0.8501384708770486, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.3838, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 900 + }, + { + "entropy": 0.4751896943897009, + "epoch": 2.2889165628891655, + "grad_norm": 0.81158047914505, + "learning_rate": 0.00021506901138115678, + "loss": 0.40689678192138673, + "mean_token_accuracy": 0.8745221219956875, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.507153491121392, + "eval_loss": 0.5501641631126404, + "eval_mean_token_accuracy": 0.8495670116918032, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.0912, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 920 + }, + { + "entropy": 0.4873133715242147, + "epoch": 2.3387297633872977, + "grad_norm": 0.7218056321144104, + "learning_rate": 0.0002142009537679292, + "loss": 0.42701358795166017, + "mean_token_accuracy": 0.8695114746689796, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5202612736543943, + "eval_loss": 0.5491839051246643, + "eval_mean_token_accuracy": 0.8494071208460386, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.1142, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 940 + }, + { + "entropy": 0.4762951169162989, + "epoch": 2.3885429638854294, + "grad_norm": 0.7194424867630005, + "learning_rate": 0.0002133024174675534, + "loss": 0.42299847602844237, + "mean_token_accuracy": 0.8709790132939815, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4899340462546016, + "eval_loss": 0.5522511601448059, + "eval_mean_token_accuracy": 0.8492208258357159, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.463, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 960 + }, + { + "entropy": 0.49650347977876663, + "epoch": 2.4383561643835616, + "grad_norm": 0.8406022787094116, + "learning_rate": 0.0002123736734663221, + "loss": 0.4275330066680908, + "mean_token_accuracy": 0.8670595556497573, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.49691385654515996, + "eval_loss": 0.5491269826889038, + "eval_mean_token_accuracy": 0.850309816210769, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.17, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 980 + }, + { + "entropy": 0.48843890577554705, + "epoch": 2.488169364881694, + "grad_norm": 0.9082473516464233, + "learning_rate": 0.00021141500186075868, + "loss": 0.4309722423553467, + "mean_token_accuracy": 0.8686766296625137, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5543508351195691, + "eval_loss": 0.5478800535202026, + "eval_mean_token_accuracy": 0.8478029522784921, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.3835, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 1000 + }, + { + "entropy": 0.4777219031006098, + "epoch": 2.5379825653798256, + "grad_norm": 0.7448089122772217, + "learning_rate": 0.0002104266917731438, + "loss": 0.423325252532959, + "mean_token_accuracy": 0.8706337086856365, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.49857561550168106, + "eval_loss": 0.5511948466300964, + "eval_mean_token_accuracy": 0.8502220289651737, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.5399, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.988, + "step": 1020 + }, + { + "entropy": 0.4844174191355705, + "epoch": 2.587795765877958, + "grad_norm": 0.794029176235199, + "learning_rate": 0.00020940904126432, + "loss": 0.4176753044128418, + "mean_token_accuracy": 0.873535567522049, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.485467542222766, + "eval_loss": 0.5539286732673645, + "eval_mean_token_accuracy": 0.8495475081510322, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.135, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 1.997, + "step": 1040 + }, + { + "entropy": 0.49070929251611234, + "epoch": 2.6376089663760895, + "grad_norm": 0.7558256983757019, + "learning_rate": 0.0002083623572438007, + "loss": 0.42867293357849123, + "mean_token_accuracy": 0.8696666076779366, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.490822730889154, + "eval_loss": 0.5434785485267639, + "eval_mean_token_accuracy": 0.850568296950917, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.4933, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 1060 + }, + { + "entropy": 0.47806114703416824, + "epoch": 2.6874221668742218, + "grad_norm": 0.6608979105949402, + "learning_rate": 0.00020728695537721047, + "loss": 0.4289727687835693, + "mean_token_accuracy": 0.8693130135536193, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.5285773256490397, + "eval_loss": 0.5444230437278748, + "eval_mean_token_accuracy": 0.8498796481032704, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.7091, + "eval_samples_per_second": 15.858, + "eval_steps_per_second": 1.984, + "step": 1080 + }, + { + "entropy": 0.5046216730028391, + "epoch": 2.7372353673723535, + "grad_norm": 0.8428544998168945, + "learning_rate": 0.00020618315999108454, + "loss": 0.43131070137023925, + "mean_token_accuracy": 0.8701941035687923, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.49888394738352576, + "eval_loss": 0.5459766387939453, + "eval_mean_token_accuracy": 0.8511758872935938, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.2222, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.995, + "step": 1100 + }, + { + "entropy": 0.5212558470666409, + "epoch": 2.7870485678704857, + "grad_norm": 1.129318118095398, + "learning_rate": 0.00020505130397505635, + "loss": 0.44249300956726073, + "mean_token_accuracy": 0.8654101334512234, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5179622324053631, + "eval_loss": 0.5522801280021667, + "eval_mean_token_accuracy": 0.8497019947268242, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.1903, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.996, + "step": 1120 + }, + { + "entropy": 0.4988406613469124, + "epoch": 2.8368617683686175, + "grad_norm": 0.6460545063018799, + "learning_rate": 0.00020389172868146263, + "loss": 0.4386270523071289, + "mean_token_accuracy": 0.8690383620560169, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.5042278484203094, + "eval_loss": 0.5433034300804138, + "eval_mean_token_accuracy": 0.8497674451317898, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.3028, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.993, + "step": 1140 + }, + { + "entropy": 0.4926559619605541, + "epoch": 2.8866749688667497, + "grad_norm": 0.8199329972267151, + "learning_rate": 0.00020270478382239615, + "loss": 0.4313485145568848, + "mean_token_accuracy": 0.8674727231264114, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.503873193160046, + "eval_loss": 0.5388111472129822, + "eval_mean_token_accuracy": 0.8526195034731266, + "eval_num_tokens": 2710196.0, + "eval_runtime": 86.4054, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.991, + "step": 1160 + }, + { + "entropy": 0.5020013231784105, + "epoch": 2.936488169364882, + "grad_norm": 0.7344821095466614, + "learning_rate": 0.00020149082736423723, + "loss": 0.43590536117553713, + "mean_token_accuracy": 0.8671772189438343, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5368241809828337, + "eval_loss": 0.5355703830718994, + "eval_mean_token_accuracy": 0.8517617773871089, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.2945, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1180 + }, + { + "entropy": 0.5112275708466768, + "epoch": 2.9863013698630136, + "grad_norm": 0.6951606869697571, + "learning_rate": 0.00020025022541969622, + "loss": 0.43579301834106443, + "mean_token_accuracy": 0.8641206480562686, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.5066795706055885, + "eval_loss": 0.5415249466896057, + "eval_mean_token_accuracy": 0.8493563373421513, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.5005, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.988, + "step": 1200 + }, + { + "entropy": 0.42298635305502474, + "epoch": 3.0348692403486925, + "grad_norm": 0.8201794028282166, + "learning_rate": 0.00019898335213739863, + "loss": 0.35593905448913576, + "mean_token_accuracy": 0.889238600547497, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.4584170470750609, + "eval_loss": 0.569487452507019, + "eval_mean_token_accuracy": 0.8495814173027526, + "eval_num_tokens": 2848509.0, + "eval_runtime": 86.2281, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 1220 + }, + { + "entropy": 0.37450140453875064, + "epoch": 3.0846824408468243, + "grad_norm": 0.7308394908905029, + "learning_rate": 0.0001976905895890471, + "loss": 0.307823920249939, + "mean_token_accuracy": 0.9001288741827012, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.45185995916294497, + "eval_loss": 0.5672881603240967, + "eval_mean_token_accuracy": 0.8511318519364955, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.0819, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.998, + "step": 1240 + }, + { + "entropy": 0.3887945845723152, + "epoch": 3.1344956413449565, + "grad_norm": 0.7299330830574036, + "learning_rate": 0.0001963723276541939, + "loss": 0.32047903537750244, + "mean_token_accuracy": 0.8960984498262405, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.44865354549053105, + "eval_loss": 0.5666037201881409, + "eval_mean_token_accuracy": 0.8496572649063066, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 1260 + }, + { + "entropy": 0.39677664265036583, + "epoch": 3.1843088418430883, + "grad_norm": 0.9533219933509827, + "learning_rate": 0.00019502896390265838, + "loss": 0.3253983497619629, + "mean_token_accuracy": 0.8964207418262958, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.4641980809527774, + "eval_loss": 0.5814996957778931, + "eval_mean_token_accuracy": 0.8485886212005171, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.7784, + "eval_samples_per_second": 15.845, + "eval_steps_per_second": 1.982, + "step": 1280 + }, + { + "entropy": 0.39210722744464876, + "epoch": 3.2341220423412205, + "grad_norm": 0.7447651028633118, + "learning_rate": 0.00019366090347462545, + "loss": 0.3276803970336914, + "mean_token_accuracy": 0.8930055953562259, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43595615254585135, + "eval_loss": 0.5722188353538513, + "eval_mean_token_accuracy": 0.8501105755567551, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.5271, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 1300 + }, + { + "entropy": 0.3684127271175385, + "epoch": 3.2839352428393527, + "grad_norm": 0.6934201121330261, + "learning_rate": 0.00019226855895846078, + "loss": 0.3156379222869873, + "mean_token_accuracy": 0.8976306475698947, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.4628148723480313, + "eval_loss": 0.5631352066993713, + "eval_mean_token_accuracy": 0.8504934813394103, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.3436, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 1320 + }, + { + "entropy": 0.4073401909321547, + "epoch": 3.3337484433374844, + "grad_norm": 0.9386897683143616, + "learning_rate": 0.00019085235026627994, + "loss": 0.34265310764312745, + "mean_token_accuracy": 0.8902062118053437, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.46455050623694133, + "eval_loss": 0.5586736798286438, + "eval_mean_token_accuracy": 0.8506874702004499, + "eval_num_tokens": 3132874.0, + "eval_runtime": 86.1286, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.997, + "step": 1340 + }, + { + "entropy": 0.4046429242938757, + "epoch": 3.383561643835616, + "grad_norm": 0.9633992314338684, + "learning_rate": 0.00018941270450730836, + "loss": 0.33816893100738527, + "mean_token_accuracy": 0.8927541889250279, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.46846531660750856, + "eval_loss": 0.561501681804657, + "eval_mean_token_accuracy": 0.8496256377114806, + "eval_num_tokens": 3178055.0, + "eval_runtime": 86.685, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1360 + }, + { + "entropy": 0.39872407019138334, + "epoch": 3.4333748443337484, + "grad_norm": 0.7786458730697632, + "learning_rate": 0.00018795005585907113, + "loss": 0.33342490196228025, + "mean_token_accuracy": 0.8944805048406124, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.42709505973860273, + "eval_loss": 0.5751848220825195, + "eval_mean_token_accuracy": 0.8507290447867194, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.6892, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 1380 + }, + { + "entropy": 0.3923338124528527, + "epoch": 3.4831880448318806, + "grad_norm": 0.9305956363677979, + "learning_rate": 0.0001864648454364511, + "loss": 0.33188116550445557, + "mean_token_accuracy": 0.8943330392241478, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.4386174779298694, + "eval_loss": 0.5680831074714661, + "eval_mean_token_accuracy": 0.8513129727784977, + "eval_num_tokens": 3274096.0, + "eval_runtime": 86.2671, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 1400 + }, + { + "entropy": 0.3856233984231949, + "epoch": 3.5330012453300124, + "grad_norm": 1.0362752676010132, + "learning_rate": 0.0001849575211586545, + "loss": 0.33098697662353516, + "mean_token_accuracy": 0.8961390435695649, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4574795474493226, + "eval_loss": 0.5630439519882202, + "eval_mean_token_accuracy": 0.8520988873964133, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.6035, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 1420 + }, + { + "entropy": 0.39812871962785723, + "epoch": 3.5828144458281446, + "grad_norm": 0.7807195782661438, + "learning_rate": 0.0001834285376141247, + "loss": 0.3333771228790283, + "mean_token_accuracy": 0.8930827379226685, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.4556825893909432, + "eval_loss": 0.5689062476158142, + "eval_mean_token_accuracy": 0.8507103507601937, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.1606, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.996, + "step": 1440 + }, + { + "entropy": 0.4147744856774807, + "epoch": 3.6326276463262763, + "grad_norm": 0.6429352164268494, + "learning_rate": 0.00018187835592344443, + "loss": 0.3482560873031616, + "mean_token_accuracy": 0.8910200245678425, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.46600024540757023, + "eval_loss": 0.5609709024429321, + "eval_mean_token_accuracy": 0.8491220876227977, + "eval_num_tokens": 3415600.0, + "eval_runtime": 86.8039, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1460 + }, + { + "entropy": 0.40425071083009245, + "epoch": 3.6824408468244085, + "grad_norm": 0.8613698482513428, + "learning_rate": 0.0001803074436002682, + "loss": 0.342916464805603, + "mean_token_accuracy": 0.8916418336331844, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.43855057899342026, + "eval_loss": 0.5720968246459961, + "eval_mean_token_accuracy": 0.8500823641932288, + "eval_num_tokens": 3460471.0, + "eval_runtime": 86.6746, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1480 + }, + { + "entropy": 0.39465143866837027, + "epoch": 3.7322540473225407, + "grad_norm": 0.6285189986228943, + "learning_rate": 0.0001787162744103265, + "loss": 0.3424591779708862, + "mean_token_accuracy": 0.8906558901071548, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4509461877304454, + "eval_loss": 0.5590082406997681, + "eval_mean_token_accuracy": 0.8511747371318729, + "eval_num_tokens": 3507647.0, + "eval_runtime": 86.8126, + "eval_samples_per_second": 15.839, + "eval_steps_per_second": 1.981, + "step": 1500 + }, + { + "entropy": 0.4021005939692259, + "epoch": 3.7820672478206725, + "grad_norm": 0.8821248412132263, + "learning_rate": 0.00017710532822854468, + "loss": 0.3462103843688965, + "mean_token_accuracy": 0.889109355956316, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.4502199075596277, + "eval_loss": 0.566046416759491, + "eval_mean_token_accuracy": 0.8501714208098345, + "eval_num_tokens": 3548934.0, + "eval_runtime": 86.8336, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.981, + "step": 1520 + }, + { + "entropy": 0.4017397932708263, + "epoch": 3.8318804483188043, + "grad_norm": 0.8400952816009521, + "learning_rate": 0.0001754750908943189, + "loss": 0.34890995025634763, + "mean_token_accuracy": 0.8892098367214203, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.4614003023435903, + "eval_loss": 0.5617933869361877, + "eval_mean_token_accuracy": 0.8515863616106122, + "eval_num_tokens": 3597186.0, + "eval_runtime": 86.4609, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 1540 + }, + { + "entropy": 0.4112051840871572, + "epoch": 3.8816936488169365, + "grad_norm": 0.769478440284729, + "learning_rate": 0.0001738260540649939, + "loss": 0.34711437225341796, + "mean_token_accuracy": 0.8911717928946018, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4540443811998811, + "eval_loss": 0.5576469898223877, + "eval_mean_token_accuracy": 0.8512079674144124, + "eval_num_tokens": 3646646.0, + "eval_runtime": 86.5103, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 1560 + }, + { + "entropy": 0.41105241514742374, + "epoch": 3.9315068493150687, + "grad_norm": 0.8468427062034607, + "learning_rate": 0.00017215871506758568, + "loss": 0.3433023452758789, + "mean_token_accuracy": 0.8898739732801915, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.4707539707075718, + "eval_loss": 0.5641466379165649, + "eval_mean_token_accuracy": 0.8495440957851188, + "eval_num_tokens": 3689560.0, + "eval_runtime": 86.609, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.986, + "step": 1580 + }, + { + "entropy": 0.41016379147768023, + "epoch": 3.9813200498132004, + "grad_norm": 0.7482675313949585, + "learning_rate": 0.0001704735767487946, + "loss": 0.34550890922546384, + "mean_token_accuracy": 0.8893028847873211, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.46391099864660307, + "eval_loss": 0.5593640804290771, + "eval_mean_token_accuracy": 0.8510130581467651, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.3975, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 1600 + }, + { + "entropy": 0.33167599791135544, + "epoch": 4.029887920298879, + "grad_norm": 0.9435692429542542, + "learning_rate": 0.00016877114732335337, + "loss": 0.2716026544570923, + "mean_token_accuracy": 0.9133149828666296, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.38499350005457567, + "eval_loss": 0.6298249363899231, + "eval_mean_token_accuracy": 0.8488117071778275, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.2933, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1620 + }, + { + "entropy": 0.3000166634097695, + "epoch": 4.0797011207970115, + "grad_norm": 0.8080845475196838, + "learning_rate": 0.0001670519402207569, + "loss": 0.22617182731628419, + "mean_token_accuracy": 0.9253474645316601, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.370110988703578, + "eval_loss": 0.6338461637496948, + "eval_mean_token_accuracy": 0.8485634801692741, + "eval_num_tokens": 3828830.0, + "eval_runtime": 85.9508, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.001, + "step": 1640 + }, + { + "entropy": 0.2986910421401262, + "epoch": 4.129514321295143, + "grad_norm": 0.7310900092124939, + "learning_rate": 0.0001653164739304185, + "loss": 0.22367463111877442, + "mean_token_accuracy": 0.9252275295555592, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.3944379702037157, + "eval_loss": 0.6109381914138794, + "eval_mean_token_accuracy": 0.849291454220927, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.6728, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1660 + }, + { + "entropy": 0.3095553796738386, + "epoch": 4.179327521793275, + "grad_norm": 0.7059140801429749, + "learning_rate": 0.0001635652718453007, + "loss": 0.23651680946350098, + "mean_token_accuracy": 0.9208931416273117, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.3910588648949945, + "eval_loss": 0.6104469299316406, + "eval_mean_token_accuracy": 0.8486883893262508, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7612, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.982, + "step": 1680 + }, + { + "entropy": 0.3001101028174162, + "epoch": 4.229140722291407, + "grad_norm": 0.6787802577018738, + "learning_rate": 0.00016179886210406728, + "loss": 0.23130471706390382, + "mean_token_accuracy": 0.9233332790434361, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3794369170832079, + "eval_loss": 0.6182110905647278, + "eval_mean_token_accuracy": 0.8495433777570724, + "eval_num_tokens": 3967474.0, + "eval_runtime": 85.94, + "eval_samples_per_second": 16.0, + "eval_steps_per_second": 2.001, + "step": 1700 + }, + { + "entropy": 0.3031421799212694, + "epoch": 4.2789539227895395, + "grad_norm": 0.9732038378715515, + "learning_rate": 0.0001600177774318036, + "loss": 0.2359529733657837, + "mean_token_accuracy": 0.9217648565769195, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3923123094231583, + "eval_loss": 0.6057384610176086, + "eval_mean_token_accuracy": 0.8508818288182103, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7647, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.29365369994193313, + "epoch": 4.328767123287671, + "grad_norm": 0.7681498527526855, + "learning_rate": 0.0001582225549793541, + "loss": 0.2269371747970581, + "mean_token_accuracy": 0.9245341829955578, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.4011661055129628, + "eval_loss": 0.6144486665725708, + "eval_mean_token_accuracy": 0.8480324357054955, + "eval_num_tokens": 4062594.0, + "eval_runtime": 87.1306, + "eval_samples_per_second": 15.781, + "eval_steps_per_second": 1.974, + "step": 1740 + }, + { + "entropy": 0.29396994728595016, + "epoch": 4.378580323785803, + "grad_norm": 1.0001007318496704, + "learning_rate": 0.0001564137361613248, + "loss": 0.22777395248413085, + "mean_token_accuracy": 0.9262309700250626, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38518730195802314, + "eval_loss": 0.6202630400657654, + "eval_mean_token_accuracy": 0.8493869807137999, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6616, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.3096018506214023, + "epoch": 4.428393524283935, + "grad_norm": 1.0448365211486816, + "learning_rate": 0.00015459186649280024, + "loss": 0.23696351051330566, + "mean_token_accuracy": 0.9217322513461113, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.3946371126140273, + "eval_loss": 0.6079026460647583, + "eval_mean_token_accuracy": 0.8492515852978063, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6582, + "eval_samples_per_second": 15.867, + "eval_steps_per_second": 1.985, + "step": 1780 + }, + { + "entropy": 0.32619857545942066, + "epoch": 4.478206724782067, + "grad_norm": 0.7210651636123657, + "learning_rate": 0.00015275749542482337, + "loss": 0.24651215076446534, + "mean_token_accuracy": 0.9177676141262054, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.3947690814560236, + "eval_loss": 0.6065912246704102, + "eval_mean_token_accuracy": 0.8502957744653835, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.5959, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.986, + "step": 1800 + }, + { + "entropy": 0.3193941755220294, + "epoch": 4.5280199252802, + "grad_norm": 0.8281906843185425, + "learning_rate": 0.0001509111761786888, + "loss": 0.23936262130737304, + "mean_token_accuracy": 0.9201708927750587, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38704028864239537, + "eval_loss": 0.6006569266319275, + "eval_mean_token_accuracy": 0.8502406720505205, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.8059, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1820 + }, + { + "entropy": 0.3164879363030195, + "epoch": 4.577833125778331, + "grad_norm": 0.7892968654632568, + "learning_rate": 0.00014905346557909867, + "loss": 0.24541733264923096, + "mean_token_accuracy": 0.9175932116806507, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.38861122120951497, + "eval_loss": 0.6115967631340027, + "eval_mean_token_accuracy": 0.849471275196519, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.2946, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1840 + }, + { + "entropy": 0.3051785985007882, + "epoch": 4.627646326276463, + "grad_norm": 0.8109654188156128, + "learning_rate": 0.0001471849238862319, + "loss": 0.23433220386505127, + "mean_token_accuracy": 0.9206570319831371, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.37162452295076015, + "eval_loss": 0.6184061765670776, + "eval_mean_token_accuracy": 0.8501173268223918, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.6865, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1860 + }, + { + "entropy": 0.3168198253959417, + "epoch": 4.677459526774595, + "grad_norm": 0.9512342214584351, + "learning_rate": 0.0001453061146267775, + "loss": 0.23832404613494873, + "mean_token_accuracy": 0.9197044663131237, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3845940856912801, + "eval_loss": 0.606762707233429, + "eval_mean_token_accuracy": 0.8504838194957999, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.5175, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 1880 + }, + { + "entropy": 0.30791807882487776, + "epoch": 4.7272727272727275, + "grad_norm": 0.8123113512992859, + "learning_rate": 0.00014341760442398248, + "loss": 0.2395785331726074, + "mean_token_accuracy": 0.918928150832653, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.39762327222283494, + "eval_loss": 0.5994202494621277, + "eval_mean_token_accuracy": 0.8509274201337681, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.2873, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.993, + "step": 1900 + }, + { + "entropy": 0.3021434534341097, + "epoch": 4.777085927770859, + "grad_norm": 0.731787383556366, + "learning_rate": 0.000141519962826766, + "loss": 0.23494718074798585, + "mean_token_accuracy": 0.9201403826475143, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.3827026732439219, + "eval_loss": 0.5995895862579346, + "eval_mean_token_accuracy": 0.851468373523202, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.3006, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 1920 + }, + { + "entropy": 0.31626159623265265, + "epoch": 4.826899128268991, + "grad_norm": 0.8848487138748169, + "learning_rate": 0.00013961376213795132, + "loss": 0.2439030647277832, + "mean_token_accuracy": 0.9196575872600079, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.388698436839636, + "eval_loss": 0.6000174283981323, + "eval_mean_token_accuracy": 0.8518068187458571, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.8979, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.979, + "step": 1940 + }, + { + "entropy": 0.30520407035946845, + "epoch": 4.876712328767123, + "grad_norm": 0.8532460927963257, + "learning_rate": 0.00013769957724166695, + "loss": 0.23458616733551024, + "mean_token_accuracy": 0.9221912942826748, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.38777847102908203, + "eval_loss": 0.6004981398582458, + "eval_mean_token_accuracy": 0.8516481768253238, + "eval_num_tokens": 4578167.0, + "eval_runtime": 87.0777, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.975, + "step": 1960 + }, + { + "entropy": 0.3226448342204094, + "epoch": 4.926525529265255, + "grad_norm": 0.6945561766624451, + "learning_rate": 0.0001357779854299694, + "loss": 0.24048397541046143, + "mean_token_accuracy": 0.9195300146937371, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.38581624263247777, + "eval_loss": 0.6029234528541565, + "eval_mean_token_accuracy": 0.8514213260523108, + "eval_num_tokens": 4622316.0, + "eval_runtime": 85.8729, + "eval_samples_per_second": 16.012, + "eval_steps_per_second": 2.003, + "step": 1980 + }, + { + "entropy": 0.3051655298098922, + "epoch": 4.976338729763388, + "grad_norm": 0.7976452708244324, + "learning_rate": 0.00013384956622874001, + "loss": 0.23584742546081544, + "mean_token_accuracy": 0.9216851457953453, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.37913159246361533, + "eval_loss": 0.6057604551315308, + "eval_mean_token_accuracy": 0.8525801203971686, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.1145, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 2000 + }, + { + "entropy": 0.27438195240803254, + "epoch": 5.024906600249066, + "grad_norm": 0.6729586124420166, + "learning_rate": 0.0001319149012229075, + "loss": 0.19775952100753785, + "mean_token_accuracy": 0.9339428559327737, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.3448961910813354, + "eval_loss": 0.6750120520591736, + "eval_mean_token_accuracy": 0.8487970232963562, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.1169, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 2020 + }, + { + "entropy": 0.21423916313797237, + "epoch": 5.074719800747198, + "grad_norm": 0.6934391856193542, + "learning_rate": 0.00012997457388105022, + "loss": 0.1439570426940918, + "mean_token_accuracy": 0.9528236843645572, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.3570949243771475, + "eval_loss": 0.6465504169464111, + "eval_mean_token_accuracy": 0.8490785547467166, + "eval_num_tokens": 4763269.0, + "eval_runtime": 85.9574, + "eval_samples_per_second": 15.996, + "eval_steps_per_second": 2.001, + "step": 2040 + }, + { + "entropy": 0.20838565267622472, + "epoch": 5.12453300124533, + "grad_norm": 0.7286986112594604, + "learning_rate": 0.00012802916937942972, + "loss": 0.14467307329177856, + "mean_token_accuracy": 0.950994835793972, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.3452463157821533, + "eval_loss": 0.6705958843231201, + "eval_mean_token_accuracy": 0.8490352796953778, + "eval_num_tokens": 4809047.0, + "eval_runtime": 86.228, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 2060 + }, + { + "entropy": 0.20453082229942082, + "epoch": 5.174346201743462, + "grad_norm": 0.7515555620193481, + "learning_rate": 0.00012607927442550974, + "loss": 0.13732000589370727, + "mean_token_accuracy": 0.9537357829511166, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.32431264914745506, + "eval_loss": 0.6743043065071106, + "eval_mean_token_accuracy": 0.8504878629085629, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.5948, + "eval_samples_per_second": 15.879, + "eval_steps_per_second": 1.986, + "step": 2080 + }, + { + "entropy": 0.21812320686876774, + "epoch": 5.224159402241594, + "grad_norm": 0.9093465209007263, + "learning_rate": 0.0001241254770810132, + "loss": 0.14311420917510986, + "mean_token_accuracy": 0.9514068141579628, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.33086285835435225, + "eval_loss": 0.6676449179649353, + "eval_mean_token_accuracy": 0.8505287662495015, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 2100 + }, + { + "entropy": 0.2180163251236081, + "epoch": 5.273972602739726, + "grad_norm": 0.6703007221221924, + "learning_rate": 0.00012216836658457075, + "loss": 0.14803968667984008, + "mean_token_accuracy": 0.9521303348243236, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.33162341708707255, + "eval_loss": 0.6658875942230225, + "eval_mean_token_accuracy": 0.8500757605530495, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.6296, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 2120 + }, + { + "entropy": 0.22511130161583423, + "epoch": 5.323785803237858, + "grad_norm": 0.8078880906105042, + "learning_rate": 0.00012020853317401455, + "loss": 0.15228408575057983, + "mean_token_accuracy": 0.947144789993763, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3354601170434508, + "eval_loss": 0.6677829623222351, + "eval_mean_token_accuracy": 0.8482600024273229, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.4689, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.989, + "step": 2140 + }, + { + "entropy": 0.2244176059961319, + "epoch": 5.37359900373599, + "grad_norm": 0.9636075496673584, + "learning_rate": 0.00011824656790837037, + "loss": 0.15260883569717407, + "mean_token_accuracy": 0.9471467643976211, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.3381616926297199, + "eval_loss": 0.6694412231445312, + "eval_mean_token_accuracy": 0.8482369603805764, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.4147, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 2160 + }, + { + "entropy": 0.22982364390045404, + "epoch": 5.423412204234122, + "grad_norm": 0.775401771068573, + "learning_rate": 0.00011628306248960262, + "loss": 0.15140302181243898, + "mean_token_accuracy": 0.9492553934454918, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.3305150235808173, + "eval_loss": 0.6717822551727295, + "eval_mean_token_accuracy": 0.8489849723355715, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.4728, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.989, + "step": 2180 + }, + { + "entropy": 0.21448935717344284, + "epoch": 5.473225404732254, + "grad_norm": 0.6575281023979187, + "learning_rate": 0.00011431860908416465, + "loss": 0.1452319622039795, + "mean_token_accuracy": 0.9505287684500218, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3488145174328671, + "eval_loss": 0.6612305641174316, + "eval_mean_token_accuracy": 0.8492907808963642, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6927, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 2200 + }, + { + "entropy": 0.23091202937066554, + "epoch": 5.523038605230386, + "grad_norm": 0.8909686207771301, + "learning_rate": 0.00011235380014440985, + "loss": 0.15150139331817628, + "mean_token_accuracy": 0.9497875183820724, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.3268539015810157, + "eval_loss": 0.6667542457580566, + "eval_mean_token_accuracy": 0.8499062903398691, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.4644, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 2220 + }, + { + "entropy": 0.2227974807843566, + "epoch": 5.572851805728518, + "grad_norm": 0.6180275082588196, + "learning_rate": 0.0001103892282299158, + "loss": 0.1491069197654724, + "mean_token_accuracy": 0.9488144010305405, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3346347655494546, + "eval_loss": 0.6665948629379272, + "eval_mean_token_accuracy": 0.8499961893918903, + "eval_num_tokens": 5226864.0, + "eval_runtime": 87.0548, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.976, + "step": 2240 + }, + { + "entropy": 0.21368421968072654, + "epoch": 5.62266500622665, + "grad_norm": 0.6004369258880615, + "learning_rate": 0.00010842548582877651, + "loss": 0.14485255479812623, + "mean_token_accuracy": 0.9502056457102299, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.32753298804163933, + "eval_loss": 0.6680151224136353, + "eval_mean_token_accuracy": 0.8515451086121936, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.8524, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.98, + "step": 2260 + }, + { + "entropy": 0.2103635374456644, + "epoch": 5.672478206724782, + "grad_norm": 0.699174702167511, + "learning_rate": 0.00010646316517891613, + "loss": 0.14297772645950318, + "mean_token_accuracy": 0.9512537539005279, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.32966585959806, + "eval_loss": 0.675578773021698, + "eval_mean_token_accuracy": 0.8509623023659684, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.4518, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.99, + "step": 2280 + }, + { + "entropy": 0.22516900151968003, + "epoch": 5.722291407222914, + "grad_norm": 0.6637354493141174, + "learning_rate": 0.00010450285808947797, + "loss": 0.15202572345733642, + "mean_token_accuracy": 0.9482452072203159, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3369456917740578, + "eval_loss": 0.6697061061859131, + "eval_mean_token_accuracy": 0.848603522361711, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.6371, + "eval_samples_per_second": 15.871, + "eval_steps_per_second": 1.985, + "step": 2300 + }, + { + "entropy": 0.21841065725311637, + "epoch": 5.772104607721046, + "grad_norm": 0.7940268516540527, + "learning_rate": 0.00010254515576234297, + "loss": 0.14710167646408082, + "mean_token_accuracy": 0.9493498183786869, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3237486180177955, + "eval_loss": 0.6779657602310181, + "eval_mean_token_accuracy": 0.8500715313955794, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.1826, + "eval_samples_per_second": 15.954, + "eval_steps_per_second": 1.996, + "step": 2320 + }, + { + "entropy": 0.22146204356104135, + "epoch": 5.821917808219178, + "grad_norm": 0.9234833121299744, + "learning_rate": 0.00010059064861383132, + "loss": 0.14720046520233154, + "mean_token_accuracy": 0.9493872679769992, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.32365207564692167, + "eval_loss": 0.6704005002975464, + "eval_mean_token_accuracy": 0.8507985760306203, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.5494, + "eval_samples_per_second": 15.887, + "eval_steps_per_second": 1.987, + "step": 2340 + }, + { + "entropy": 0.20934011954814197, + "epoch": 5.87173100871731, + "grad_norm": 0.5547503232955933, + "learning_rate": 9.863992609664084e-05, + "loss": 0.1464867353439331, + "mean_token_accuracy": 0.9503875687718392, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.3330401429083458, + "eval_loss": 0.6659091114997864, + "eval_mean_token_accuracy": 0.8504848906467127, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.5855, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 2360 + }, + { + "entropy": 0.21678635366261007, + "epoch": 5.921544209215442, + "grad_norm": 0.570612907409668, + "learning_rate": 9.669357652207635e-05, + "loss": 0.14821385145187377, + "mean_token_accuracy": 0.9503940217196941, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3322022325077722, + "eval_loss": 0.6722489595413208, + "eval_mean_token_accuracy": 0.8489979422369669, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.2986, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 2380 + }, + { + "entropy": 0.20932920072227718, + "epoch": 5.971357409713574, + "grad_norm": 0.7879557609558105, + "learning_rate": 9.475218688262262e-05, + "loss": 0.14675841331481934, + "mean_token_accuracy": 0.9507176131010056, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.3199348642902319, + "eval_loss": 0.6698136329650879, + "eval_mean_token_accuracy": 0.8514142130003419, + "eval_num_tokens": 5605400.0, + "eval_runtime": 85.8995, + "eval_samples_per_second": 16.007, + "eval_steps_per_second": 2.002, + "step": 2400 + }, + { + "entropy": 0.21032143919131693, + "epoch": 6.019925280199253, + "grad_norm": 0.5823076367378235, + "learning_rate": 9.281634267491569e-05, + "loss": 0.13322267532348633, + "mean_token_accuracy": 0.9550939072401096, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.30206270117399303, + "eval_loss": 0.7093168497085571, + "eval_mean_token_accuracy": 0.8500627639681794, + "eval_num_tokens": 5648968.0, + "eval_runtime": 85.8128, + "eval_samples_per_second": 16.023, + "eval_steps_per_second": 2.004, + "step": 2420 + }, + { + "entropy": 0.1534628233872354, + "epoch": 6.069738480697385, + "grad_norm": 0.710133969783783, + "learning_rate": 9.088662772316508e-05, + "loss": 0.09078952670097351, + "mean_token_accuracy": 0.9678447999060154, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.28208133101809857, + "eval_loss": 0.7636417150497437, + "eval_mean_token_accuracy": 0.8494061477655588, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9724, + "eval_samples_per_second": 15.994, + "eval_steps_per_second": 2.001, + "step": 2440 + }, + { + "entropy": 0.16151462448760867, + "epoch": 6.119551681195516, + "grad_norm": 0.5793812274932861, + "learning_rate": 8.896362400308028e-05, + "loss": 0.09545697569847107, + "mean_token_accuracy": 0.9671573750674725, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.2833245605403601, + "eval_loss": 0.7402405738830566, + "eval_mean_token_accuracy": 0.8503523728875226, + "eval_num_tokens": 5745090.0, + "eval_runtime": 85.5461, + "eval_samples_per_second": 16.073, + "eval_steps_per_second": 2.011, + "step": 2460 + }, + { + "entropy": 0.15203177919611335, + "epoch": 6.169364881693649, + "grad_norm": 0.4251123368740082, + "learning_rate": 8.704791146635483e-05, + "loss": 0.09420782327651978, + "mean_token_accuracy": 0.9677386932075024, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.28572545962971313, + "eval_loss": 0.735416829586029, + "eval_mean_token_accuracy": 0.8487084663884584, + "eval_num_tokens": 5790333.0, + "eval_runtime": 85.4801, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.012, + "step": 2480 + }, + { + "entropy": 0.15587336672469973, + "epoch": 6.219178082191781, + "grad_norm": 0.4357028007507324, + "learning_rate": 8.514006786576085e-05, + "loss": 0.09429320096969604, + "mean_token_accuracy": 0.9682952925562859, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.2859006894882335, + "eval_loss": 0.7347224950790405, + "eval_mean_token_accuracy": 0.8501905518215757, + "eval_num_tokens": 5837321.0, + "eval_runtime": 85.7578, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.006, + "step": 2500 + }, + { + "entropy": 0.15765639198943973, + "epoch": 6.268991282689913, + "grad_norm": 0.47331130504608154, + "learning_rate": 8.324066858090663e-05, + "loss": 0.09571113586425781, + "mean_token_accuracy": 0.9683481335639954, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.29231513846059176, + "eval_loss": 0.7392512559890747, + "eval_mean_token_accuracy": 0.8486633983462356, + "eval_num_tokens": 5884398.0, + "eval_runtime": 85.7846, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.005, + "step": 2520 + }, + { + "entropy": 0.16176860257983208, + "epoch": 6.318804483188045, + "grad_norm": 0.6142018437385559, + "learning_rate": 8.135028644470992e-05, + "loss": 0.09486144185066223, + "mean_token_accuracy": 0.9682316601276397, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.2851274753379267, + "eval_loss": 0.7520816922187805, + "eval_mean_token_accuracy": 0.8501113649717597, + "eval_num_tokens": 5929876.0, + "eval_runtime": 85.9425, + "eval_samples_per_second": 15.999, + "eval_steps_per_second": 2.001, + "step": 2540 + }, + { + "entropy": 0.15404034564271568, + "epoch": 6.3686176836861765, + "grad_norm": 0.6051287651062012, + "learning_rate": 7.946949157063964e-05, + "loss": 0.09280472993850708, + "mean_token_accuracy": 0.9684635892510414, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28802703563557114, + "eval_loss": 0.7439162135124207, + "eval_mean_token_accuracy": 0.8499851770872293, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.0703, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.998, + "step": 2560 + }, + { + "entropy": 0.15343588953837753, + "epoch": 6.418430884184309, + "grad_norm": 0.4823743402957916, + "learning_rate": 7.759885118077701e-05, + "loss": 0.09000591039657593, + "mean_token_accuracy": 0.9699928767979145, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2795634938533916, + "eval_loss": 0.7647850513458252, + "eval_mean_token_accuracy": 0.8503464397995971, + "eval_num_tokens": 6025380.0, + "eval_runtime": 85.8886, + "eval_samples_per_second": 16.009, + "eval_steps_per_second": 2.003, + "step": 2580 + }, + { + "entropy": 0.15740026142448188, + "epoch": 6.468244084682441, + "grad_norm": 0.5082696676254272, + "learning_rate": 7.57389294347494e-05, + "loss": 0.09191849827766418, + "mean_token_accuracy": 0.9692809768021107, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2913342311458532, + "eval_loss": 0.7518694996833801, + "eval_mean_token_accuracy": 0.8483168302580367, + "eval_num_tokens": 6073349.0, + "eval_runtime": 85.5761, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.01, + "step": 2600 + }, + { + "entropy": 0.15922069251537324, + "epoch": 6.518057285180573, + "grad_norm": 0.3995199501514435, + "learning_rate": 7.389028725958736e-05, + "loss": 0.09584367871284485, + "mean_token_accuracy": 0.9685114495456218, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.2863075934177221, + "eval_loss": 0.7539381384849548, + "eval_mean_token_accuracy": 0.8507507083027862, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.112, + "eval_samples_per_second": 15.968, + "eval_steps_per_second": 1.997, + "step": 2620 + }, + { + "entropy": 0.16197575423866512, + "epoch": 6.567870485678705, + "grad_norm": 0.534295380115509, + "learning_rate": 7.205348218055678e-05, + "loss": 0.0961170256137848, + "mean_token_accuracy": 0.9674530044198036, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.29021967315050057, + "eval_loss": 0.751198947429657, + "eval_mean_token_accuracy": 0.8509796344956686, + "eval_num_tokens": 6165523.0, + "eval_runtime": 85.7958, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.005, + "step": 2640 + }, + { + "entropy": 0.15261746793985367, + "epoch": 6.617683686176837, + "grad_norm": 0.5391237139701843, + "learning_rate": 7.022906815301673e-05, + "loss": 0.0926026999950409, + "mean_token_accuracy": 0.9695659473538398, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.29128045216202736, + "eval_loss": 0.7450292110443115, + "eval_mean_token_accuracy": 0.8498771443616512, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.3963, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 2660 + }, + { + "entropy": 0.16164180357009172, + "epoch": 6.667496886674969, + "grad_norm": 0.5767946243286133, + "learning_rate": 6.841759539535419e-05, + "loss": 0.09291981458663941, + "mean_token_accuracy": 0.9687136687338352, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2897637223088464, + "eval_loss": 0.7503410577774048, + "eval_mean_token_accuracy": 0.8503315164599308, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.0653, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.998, + "step": 2680 + }, + { + "entropy": 0.17062523355707526, + "epoch": 6.717310087173101, + "grad_norm": 0.4974168539047241, + "learning_rate": 6.661961022304563e-05, + "loss": 0.09713236689567566, + "mean_token_accuracy": 0.9661971725523472, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2765843396963075, + "eval_loss": 0.7604002356529236, + "eval_mean_token_accuracy": 0.8521115277395692, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.1676, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 2700 + }, + { + "entropy": 0.17544092936441302, + "epoch": 6.767123287671232, + "grad_norm": 0.5523537993431091, + "learning_rate": 6.483565488389582e-05, + "loss": 0.09709116220474243, + "mean_token_accuracy": 0.9650957375764847, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.27939334659035814, + "eval_loss": 0.7534670829772949, + "eval_mean_token_accuracy": 0.851230604010959, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.2913, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 2720 + }, + { + "entropy": 0.15991022661328316, + "epoch": 6.816936488169365, + "grad_norm": 0.478551983833313, + "learning_rate": 6.306626739450311e-05, + "loss": 0.09564646482467651, + "mean_token_accuracy": 0.9679084822535515, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.27878295491601146, + "eval_loss": 0.7519959211349487, + "eval_mean_token_accuracy": 0.8510654949864676, + "eval_num_tokens": 6397720.0, + "eval_runtime": 85.9109, + "eval_samples_per_second": 16.005, + "eval_steps_per_second": 2.002, + "step": 2740 + }, + { + "entropy": 0.16824879590421915, + "epoch": 6.866749688667497, + "grad_norm": 0.6681098937988281, + "learning_rate": 6.131198137800108e-05, + "loss": 0.0962279736995697, + "mean_token_accuracy": 0.966830012947321, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.2834690434121808, + "eval_loss": 0.751922070980072, + "eval_mean_token_accuracy": 0.8521237577809844, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.3618, + "eval_samples_per_second": 15.921, + "eval_steps_per_second": 1.992, + "step": 2760 + }, + { + "entropy": 0.1518704930320382, + "epoch": 6.916562889165629, + "grad_norm": 0.5201290249824524, + "learning_rate": 5.957332590312513e-05, + "loss": 0.09010660648345947, + "mean_token_accuracy": 0.9693463340401649, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.28485129617674404, + "eval_loss": 0.7452457547187805, + "eval_mean_token_accuracy": 0.8512036796919135, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.4524, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.99, + "step": 2780 + }, + { + "entropy": 0.15512610590085388, + "epoch": 6.966376089663761, + "grad_norm": 0.42802050709724426, + "learning_rate": 5.785082532465233e-05, + "loss": 0.09320432543754578, + "mean_token_accuracy": 0.9686134628951549, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.27554594526110693, + "eval_loss": 0.7644653916358948, + "eval_mean_token_accuracy": 0.8513738523389018, + "eval_num_tokens": 6540175.0, + "eval_runtime": 85.7609, + "eval_samples_per_second": 16.033, + "eval_steps_per_second": 2.006, + "step": 2800 + }, + { + "entropy": 0.17524497526196334, + "epoch": 7.01494396014944, + "grad_norm": 0.3330269157886505, + "learning_rate": 5.6144999125263545e-05, + "loss": 0.0895616888999939, + "mean_token_accuracy": 0.9682766932707566, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.2735865569218647, + "eval_loss": 0.768479585647583, + "eval_mean_token_accuracy": 0.8503459383581959, + "eval_num_tokens": 6583767.0, + "eval_runtime": 85.7162, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.007, + "step": 2820 + }, + { + "entropy": 0.1403565663844347, + "epoch": 7.064757160647572, + "grad_norm": 0.35613498091697693, + "learning_rate": 5.4456361758874235e-05, + "loss": 0.07551313638687134, + "mean_token_accuracy": 0.9739301167428493, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.25941789089593775, + "eval_loss": 0.8209511637687683, + "eval_mean_token_accuracy": 0.8505055855873019, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.0943, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 2840 + }, + { + "entropy": 0.13500106502324344, + "epoch": 7.114570361145703, + "grad_norm": 0.34418627619743347, + "learning_rate": 5.2785422495482234e-05, + "loss": 0.07293946146965027, + "mean_token_accuracy": 0.9747208289802074, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.26482899772912954, + "eval_loss": 0.798904538154602, + "eval_mean_token_accuracy": 0.8511530233677044, + "eval_num_tokens": 6672946.0, + "eval_runtime": 85.7915, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.005, + "step": 2860 + }, + { + "entropy": 0.13127502552233636, + "epoch": 7.164383561643835, + "grad_norm": 0.4638441503047943, + "learning_rate": 5.113268526757892e-05, + "loss": 0.07121461629867554, + "mean_token_accuracy": 0.9756786689162255, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2645381211714689, + "eval_loss": 0.809101939201355, + "eval_mean_token_accuracy": 0.8514727898115335, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.84, + "eval_samples_per_second": 16.018, + "eval_steps_per_second": 2.004, + "step": 2880 + }, + { + "entropy": 0.1331390908919275, + "epoch": 7.214196762141968, + "grad_norm": 0.40206775069236755, + "learning_rate": 4.949864851817007e-05, + "loss": 0.07188264131546021, + "mean_token_accuracy": 0.9755406074225903, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.26244733283339544, + "eval_loss": 0.8143188953399658, + "eval_mean_token_accuracy": 0.8514358189909957, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.8546, + "eval_samples_per_second": 16.015, + "eval_steps_per_second": 2.003, + "step": 2900 + }, + { + "entropy": 0.13647331558167936, + "epoch": 7.2640099626401, + "grad_norm": 0.26405787467956543, + "learning_rate": 4.788380505045224e-05, + "loss": 0.07412450313568116, + "mean_token_accuracy": 0.9744274213910102, + "num_tokens": 6809678.0, + "step": 2920 + }, + { + "epoch": 7.2640099626401, + "eval_entropy": 0.2626111418182074, + "eval_loss": 0.8111525177955627, + "eval_mean_token_accuracy": 0.8512121695418691, + "eval_num_tokens": 6809678.0, + "eval_runtime": 85.9626, + "eval_samples_per_second": 15.995, + "eval_steps_per_second": 2.001, + "step": 2920 + }, + { + "entropy": 0.12644002586603165, + "epoch": 7.313823163138232, + "grad_norm": 0.27514681220054626, + "learning_rate": 4.6288641879189884e-05, + "loss": 0.06807711124420165, + "mean_token_accuracy": 0.9760703906416893, + "num_tokens": 6860750.0, + "step": 2940 + }, + { + "epoch": 7.313823163138232, + "eval_entropy": 0.26096762734097106, + "eval_loss": 0.8184595108032227, + "eval_mean_token_accuracy": 0.8501476153384807, + "eval_num_tokens": 6860750.0, + "eval_runtime": 85.9521, + "eval_samples_per_second": 15.997, + "eval_steps_per_second": 2.001, + "step": 2940 + }, + { + "entropy": 0.13920630998909472, + "epoch": 7.363636363636363, + "grad_norm": 0.23584705591201782, + "learning_rate": 4.4713640083838604e-05, + "loss": 0.07301607131958007, + "mean_token_accuracy": 0.9745715200901032, + "num_tokens": 6907092.0, + "step": 2960 + }, + { + "epoch": 7.363636363636363, + "eval_entropy": 0.2612536767021168, + "eval_loss": 0.8116245269775391, + "eval_mean_token_accuracy": 0.8510967350976412, + "eval_num_tokens": 6907092.0, + "eval_runtime": 85.6373, + "eval_samples_per_second": 16.056, + "eval_steps_per_second": 2.008, + "step": 2960 + }, + { + "entropy": 0.1349492883309722, + "epoch": 7.4134495641344955, + "grad_norm": 0.24552719295024872, + "learning_rate": 4.315927466345791e-05, + "loss": 0.07397544980049134, + "mean_token_accuracy": 0.9745095103979111, + "num_tokens": 6952700.0, + "step": 2980 + }, + { + "epoch": 7.4134495641344955, + "eval_entropy": 0.25796533306670744, + "eval_loss": 0.8266491293907166, + "eval_mean_token_accuracy": 0.8511653857868772, + "eval_num_tokens": 6952700.0, + "eval_runtime": 85.7462, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.006, + "step": 2980 + }, + { + "entropy": 0.14479175000451505, + "epoch": 7.463262764632628, + "grad_norm": 0.2846072018146515, + "learning_rate": 4.162601439345814e-05, + "loss": 0.07544798254966736, + "mean_token_accuracy": 0.9727819666266442, + "num_tokens": 6996430.0, + "step": 3000 + }, + { + "epoch": 7.463262764632628, + "eval_entropy": 0.2584348309698493, + "eval_loss": 0.8253348469734192, + "eval_mean_token_accuracy": 0.8511569815319638, + "eval_num_tokens": 6996430.0, + "eval_runtime": 86.2984, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 3000 + }, + { + "entropy": 0.14114196319133043, + "epoch": 7.51307596513076, + "grad_norm": 0.407966285943985, + "learning_rate": 4.011432168422419e-05, + "loss": 0.0736398994922638, + "mean_token_accuracy": 0.9741654269397259, + "num_tokens": 7042038.0, + "step": 3020 + }, + { + "epoch": 7.51307596513076, + "eval_entropy": 0.25232676260693127, + "eval_loss": 0.8296052813529968, + "eval_mean_token_accuracy": 0.8523298349491385, + "eval_num_tokens": 7042038.0, + "eval_runtime": 85.8445, + "eval_samples_per_second": 16.017, + "eval_steps_per_second": 2.004, + "step": 3020 + }, + { + "entropy": 0.1353456223383546, + "epoch": 7.562889165628892, + "grad_norm": 0.2712634801864624, + "learning_rate": 3.8624652441658684e-05, + "loss": 0.07362412214279175, + "mean_token_accuracy": 0.9747945807874203, + "num_tokens": 7089390.0, + "step": 3040 + }, + { + "epoch": 7.562889165628892, + "eval_entropy": 0.2579477243991785, + "eval_loss": 0.8274564743041992, + "eval_mean_token_accuracy": 0.8517705212498821, + "eval_num_tokens": 7089390.0, + "eval_runtime": 85.8222, + "eval_samples_per_second": 16.022, + "eval_steps_per_second": 2.004, + "step": 3040 + }, + { + "entropy": 0.1296080862637609, + "epoch": 7.6127023661270234, + "grad_norm": 0.2371893972158432, + "learning_rate": 3.715745592968707e-05, + "loss": 0.06971035599708557, + "mean_token_accuracy": 0.9759043246507645, + "num_tokens": 7138002.0, + "step": 3060 + }, + { + "epoch": 7.6127023661270234, + "eval_entropy": 0.25391967083479083, + "eval_loss": 0.8197130560874939, + "eval_mean_token_accuracy": 0.8522267875283264, + "eval_num_tokens": 7138002.0, + "eval_runtime": 85.8796, + "eval_samples_per_second": 16.011, + "eval_steps_per_second": 2.003, + "step": 3060 + }, + { + "entropy": 0.1311203008517623, + "epoch": 7.662515566625156, + "grad_norm": 0.22499267756938934, + "learning_rate": 3.5713174634765967e-05, + "loss": 0.07176244258880615, + "mean_token_accuracy": 0.9754939571022987, + "num_tokens": 7185520.0, + "step": 3080 + }, + { + "epoch": 7.662515566625156, + "eval_entropy": 0.2526215241225653, + "eval_loss": 0.8265154361724854, + "eval_mean_token_accuracy": 0.8519952584837758, + "eval_num_tokens": 7185520.0, + "eval_runtime": 85.8746, + "eval_samples_per_second": 16.012, + "eval_steps_per_second": 2.003, + "step": 3080 + }, + { + "entropy": 0.13420484317466616, + "epoch": 7.712328767123288, + "grad_norm": 0.2398064285516739, + "learning_rate": 3.4292244132434866e-05, + "loss": 0.07559212446212768, + "mean_token_accuracy": 0.9743142127990723, + "num_tokens": 7232170.0, + "step": 3100 + }, + { + "epoch": 7.712328767123288, + "eval_entropy": 0.2484562756537005, + "eval_loss": 0.8312150239944458, + "eval_mean_token_accuracy": 0.8528405119513356, + "eval_num_tokens": 7232170.0, + "eval_runtime": 85.7896, + "eval_samples_per_second": 16.028, + "eval_steps_per_second": 2.005, + "step": 3100 + }, + { + "entropy": 0.11965563679113984, + "epoch": 7.76214196762142, + "grad_norm": 0.3408384919166565, + "learning_rate": 3.2895092955952746e-05, + "loss": 0.0661750853061676, + "mean_token_accuracy": 0.9776600524783134, + "num_tokens": 7282846.0, + "step": 3120 + }, + { + "epoch": 7.76214196762142, + "eval_entropy": 0.2522421533804993, + "eval_loss": 0.8327009677886963, + "eval_mean_token_accuracy": 0.8524222023958383, + "eval_num_tokens": 7282846.0, + "eval_runtime": 86.1769, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 1.996, + "step": 3120 + }, + { + "entropy": 0.13388084415346385, + "epoch": 7.811955168119551, + "grad_norm": 0.35418516397476196, + "learning_rate": 3.152214246705829e-05, + "loss": 0.07149899601936341, + "mean_token_accuracy": 0.9747635535895824, + "num_tokens": 7331518.0, + "step": 3140 + }, + { + "epoch": 7.811955168119551, + "eval_entropy": 0.25038352296795957, + "eval_loss": 0.836457371711731, + "eval_mean_token_accuracy": 0.8526130665180295, + "eval_num_tokens": 7331518.0, + "eval_runtime": 85.6099, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.009, + "step": 3140 + }, + { + "entropy": 0.13530643959529698, + "epoch": 7.861768368617684, + "grad_norm": 0.38060539960861206, + "learning_rate": 3.017380672889291e-05, + "loss": 0.07116585969924927, + "mean_token_accuracy": 0.973284512758255, + "num_tokens": 7379056.0, + "step": 3160 + }, + { + "epoch": 7.861768368617684, + "eval_entropy": 0.255092611319797, + "eval_loss": 0.8314701914787292, + "eval_mean_token_accuracy": 0.8520913099826768, + "eval_num_tokens": 7379056.0, + "eval_runtime": 85.877, + "eval_samples_per_second": 16.011, + "eval_steps_per_second": 2.003, + "step": 3160 + }, + { + "entropy": 0.13383390177041293, + "epoch": 7.911581569115816, + "grad_norm": 0.3827536106109619, + "learning_rate": 2.8850492381124808e-05, + "loss": 0.07305437326431274, + "mean_token_accuracy": 0.9750778004527092, + "num_tokens": 7424770.0, + "step": 3180 + }, + { + "epoch": 7.911581569115816, + "eval_entropy": 0.25416371157003004, + "eval_loss": 0.8206402063369751, + "eval_mean_token_accuracy": 0.852779901651449, + "eval_num_tokens": 7424770.0, + "eval_runtime": 86.1015, + "eval_samples_per_second": 15.97, + "eval_steps_per_second": 1.998, + "step": 3180 + }, + { + "entropy": 0.1395680439658463, + "epoch": 7.961394769613948, + "grad_norm": 0.3809775412082672, + "learning_rate": 2.7552598517312256e-05, + "loss": 0.07236042022705078, + "mean_token_accuracy": 0.9731538116931915, + "num_tokens": 7470804.0, + "step": 3200 + }, + { + "epoch": 7.961394769613948, + "eval_entropy": 0.25528111975899964, + "eval_loss": 0.8230037093162537, + "eval_mean_token_accuracy": 0.8526452603035195, + "eval_num_tokens": 7470804.0, + "eval_runtime": 85.7895, + "eval_samples_per_second": 16.028, + "eval_steps_per_second": 2.005, + "step": 3200 + }, + { + "entropy": 0.12193699864049752, + "epoch": 8.009962640099626, + "grad_norm": 0.11854425817728043, + "learning_rate": 2.6280516564542205e-05, + "loss": 0.06617764234542847, + "mean_token_accuracy": 0.977179691577569, + "num_tokens": 7518110.0, + "step": 3220 + }, + { + "epoch": 8.009962640099626, + "eval_entropy": 0.25100527677771656, + "eval_loss": 0.8393343687057495, + "eval_mean_token_accuracy": 0.8522553132023922, + "eval_num_tokens": 7518110.0, + "eval_runtime": 85.8837, + "eval_samples_per_second": 16.01, + "eval_steps_per_second": 2.003, + "step": 3220 + }, + { + "entropy": 0.12788885813206435, + "epoch": 8.059775840597759, + "grad_norm": 0.16094881296157837, + "learning_rate": 2.50346301653812e-05, + "loss": 0.06274186968803405, + "mean_token_accuracy": 0.9766994707286358, + "num_tokens": 7565539.0, + "step": 3240 + }, + { + "epoch": 8.059775840597759, + "eval_entropy": 0.24409458682287571, + "eval_loss": 0.874617338180542, + "eval_mean_token_accuracy": 0.8521041180505309, + "eval_num_tokens": 7565539.0, + "eval_runtime": 86.2656, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 3240 + }, + { + "entropy": 0.12464155335910618, + "epoch": 8.10958904109589, + "grad_norm": 0.16893954575061798, + "learning_rate": 2.381531506217437e-05, + "loss": 0.06093020439147949, + "mean_token_accuracy": 0.9776258453726768, + "num_tokens": 7612578.0, + "step": 3260 + }, + { + "epoch": 8.10958904109589, + "eval_entropy": 0.24396493017326953, + "eval_loss": 0.891161322593689, + "eval_mean_token_accuracy": 0.8515338024427724, + "eval_num_tokens": 7612578.0, + "eval_runtime": 85.9061, + "eval_samples_per_second": 16.006, + "eval_steps_per_second": 2.002, + "step": 3260 + }, + { + "entropy": 0.12345920228399336, + "epoch": 8.159402241594023, + "grad_norm": 0.14332273602485657, + "learning_rate": 2.262293898372616e-05, + "loss": 0.061289966106414795, + "mean_token_accuracy": 0.9762230902910233, + "num_tokens": 7660157.0, + "step": 3280 + }, + { + "epoch": 8.159402241594023, + "eval_entropy": 0.2481445314059424, + "eval_loss": 0.8922848105430603, + "eval_mean_token_accuracy": 0.8514944855556932, + "eval_num_tokens": 7660157.0, + "eval_runtime": 85.5201, + "eval_samples_per_second": 16.078, + "eval_steps_per_second": 2.011, + "step": 3280 + }, + { + "entropy": 0.12298110066913068, + "epoch": 8.209215442092155, + "grad_norm": 0.21848882734775543, + "learning_rate": 2.1457861534398633e-05, + "loss": 0.05986443758010864, + "mean_token_accuracy": 0.9786281704902648, + "num_tokens": 7709745.0, + "step": 3300 + }, + { + "epoch": 8.209215442092155, + "eval_entropy": 0.24329388124305149, + "eval_loss": 0.9021085500717163, + "eval_mean_token_accuracy": 0.8521762625422589, + "eval_num_tokens": 7709745.0, + "eval_runtime": 85.955, + "eval_samples_per_second": 15.997, + "eval_steps_per_second": 2.001, + "step": 3300 + }, + { + "entropy": 0.13265180448070168, + "epoch": 8.259028642590286, + "grad_norm": 0.18067947030067444, + "learning_rate": 2.0320434085659692e-05, + "loss": 0.06724961400032044, + "mean_token_accuracy": 0.975098168104887, + "num_tokens": 7753571.0, + "step": 3320 + }, + { + "epoch": 8.259028642590286, + "eval_entropy": 0.2433211464694766, + "eval_loss": 0.9094350337982178, + "eval_mean_token_accuracy": 0.8520150094531304, + "eval_num_tokens": 7753571.0, + "eval_runtime": 85.7989, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.005, + "step": 3320 + }, + { + "entropy": 0.11949320202693343, + "epoch": 8.308841843088418, + "grad_norm": 0.17020289599895477, + "learning_rate": 1.9210999670114196e-05, + "loss": 0.0634455680847168, + "mean_token_accuracy": 0.9771294385194779, + "num_tokens": 7799310.0, + "step": 3340 + }, + { + "epoch": 8.308841843088418, + "eval_entropy": 0.24345201219237128, + "eval_loss": 0.9021793603897095, + "eval_mean_token_accuracy": 0.8520745697409607, + "eval_num_tokens": 7799310.0, + "eval_runtime": 86.0883, + "eval_samples_per_second": 15.972, + "eval_steps_per_second": 1.998, + "step": 3340 + }, + { + "entropy": 0.12065747743472457, + "epoch": 8.35865504358655, + "grad_norm": 0.16789060831069946, + "learning_rate": 1.8129892878049886e-05, + "loss": 0.061494195461273195, + "mean_token_accuracy": 0.9779584899544715, + "num_tokens": 7846447.0, + "step": 3360 + }, + { + "epoch": 8.35865504358655, + "eval_entropy": 0.24093415042342142, + "eval_loss": 0.9006755352020264, + "eval_mean_token_accuracy": 0.852174230786257, + "eval_num_tokens": 7846447.0, + "eval_runtime": 85.9011, + "eval_samples_per_second": 16.007, + "eval_steps_per_second": 2.002, + "step": 3360 + }, + { + "entropy": 0.13125578537583352, + "epoch": 8.408468244084682, + "grad_norm": 0.1662452220916748, + "learning_rate": 1.70774397565298e-05, + "loss": 0.06685600876808166, + "mean_token_accuracy": 0.9744067586958408, + "num_tokens": 7890283.0, + "step": 3380 + }, + { + "epoch": 8.408468244084682, + "eval_entropy": 0.24062153688350388, + "eval_loss": 0.9078915119171143, + "eval_mean_token_accuracy": 0.8523201647886011, + "eval_num_tokens": 7890283.0, + "eval_runtime": 86.0201, + "eval_samples_per_second": 15.985, + "eval_steps_per_second": 2.0, + "step": 3380 + }, + { + "entropy": 0.11986117120832204, + "epoch": 8.458281444582815, + "grad_norm": 0.19571948051452637, + "learning_rate": 1.6053957711060606e-05, + "loss": 0.06411095261573792, + "mean_token_accuracy": 0.9770627245306969, + "num_tokens": 7936518.0, + "step": 3400 + }, + { + "epoch": 8.458281444582815, + "eval_entropy": 0.24352820347561394, + "eval_loss": 0.9058943390846252, + "eval_mean_token_accuracy": 0.8519382792156797, + "eval_num_tokens": 7936518.0, + "eval_runtime": 85.966, + "eval_samples_per_second": 15.995, + "eval_steps_per_second": 2.001, + "step": 3400 + }, + { + "entropy": 0.12857897616922856, + "epoch": 8.508094645080947, + "grad_norm": 0.2609264850616455, + "learning_rate": 1.5059755409867613e-05, + "loss": 0.06473397612571716, + "mean_token_accuracy": 0.9764650195837021, + "num_tokens": 7981966.0, + "step": 3420 + }, + { + "epoch": 8.508094645080947, + "eval_entropy": 0.24032609000108962, + "eval_loss": 0.9077776074409485, + "eval_mean_token_accuracy": 0.8517829197090726, + "eval_num_tokens": 7981966.0, + "eval_runtime": 86.6059, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 3420 + }, + { + "entropy": 0.12348870886489749, + "epoch": 8.557907845579079, + "grad_norm": 0.19537609815597534, + "learning_rate": 1.409513269080473e-05, + "loss": 0.06481348872184753, + "mean_token_accuracy": 0.9769559659063816, + "num_tokens": 8028367.0, + "step": 3440 + }, + { + "epoch": 8.557907845579079, + "eval_entropy": 0.2404322574824788, + "eval_loss": 0.9057720899581909, + "eval_mean_token_accuracy": 0.8521037981953732, + "eval_num_tokens": 8028367.0, + "eval_runtime": 86.166, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.996, + "step": 3440 + }, + { + "entropy": 0.12040232736617326, + "epoch": 8.607721046077211, + "grad_norm": 0.3310582935810089, + "learning_rate": 1.3160380470927183e-05, + "loss": 0.06468871235847473, + "mean_token_accuracy": 0.9768650442361831, + "num_tokens": 8074934.0, + "step": 3460 + }, + { + "epoch": 8.607721046077211, + "eval_entropy": 0.24118655876711356, + "eval_loss": 0.9028318524360657, + "eval_mean_token_accuracy": 0.8521025340224422, + "eval_num_tokens": 8074934.0, + "eval_runtime": 85.3668, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.015, + "step": 3460 + }, + { + "entropy": 0.12328103906475008, + "epoch": 8.657534246575342, + "grad_norm": 0.12836167216300964, + "learning_rate": 1.2255780658755122e-05, + "loss": 0.06229386329650879, + "mean_token_accuracy": 0.9763277888298034, + "num_tokens": 8122775.0, + "step": 3480 + }, + { + "epoch": 8.657534246575342, + "eval_entropy": 0.24194598145956217, + "eval_loss": 0.9009329080581665, + "eval_mean_token_accuracy": 0.8521693289973015, + "eval_num_tokens": 8122775.0, + "eval_runtime": 85.9415, + "eval_samples_per_second": 15.999, + "eval_steps_per_second": 2.001, + "step": 3480 + }, + { + "entropy": 0.11321646976284683, + "epoch": 8.707347447073474, + "grad_norm": 0.15656894445419312, + "learning_rate": 1.1381606069253786e-05, + "loss": 0.05908188819885254, + "mean_token_accuracy": 0.9779504477977753, + "num_tokens": 8174307.0, + "step": 3500 + }, + { + "epoch": 8.707347447073474, + "eval_entropy": 0.24121542517528977, + "eval_loss": 0.9016091823577881, + "eval_mean_token_accuracy": 0.8521790667328724, + "eval_num_tokens": 8174307.0, + "eval_runtime": 85.7465, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.006, + "step": 3500 + }, + { + "entropy": 0.12657046681270004, + "epoch": 8.757160647571606, + "grad_norm": 0.22597502171993256, + "learning_rate": 1.053812034155629e-05, + "loss": 0.06244581937789917, + "mean_token_accuracy": 0.976795207709074, + "num_tokens": 8222808.0, + "step": 3520 + }, + { + "epoch": 8.757160647571606, + "eval_entropy": 0.23877542708502258, + "eval_loss": 0.9069110155105591, + "eval_mean_token_accuracy": 0.8522880177858264, + "eval_num_tokens": 8222808.0, + "eval_runtime": 85.7792, + "eval_samples_per_second": 16.03, + "eval_steps_per_second": 2.005, + "step": 3520 + }, + { + "entropy": 0.11422101808711886, + "epoch": 8.806973848069738, + "grad_norm": 0.21139323711395264, + "learning_rate": 9.725577859453502e-06, + "loss": 0.05988085865974426, + "mean_token_accuracy": 0.9779510758817196, + "num_tokens": 8273335.0, + "step": 3540 + }, + { + "epoch": 8.806973848069738, + "eval_entropy": 0.2393161087881687, + "eval_loss": 0.9033801555633545, + "eval_mean_token_accuracy": 0.8522614209457885, + "eval_num_tokens": 8273335.0, + "eval_runtime": 85.5594, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 3540 + }, + { + "entropy": 0.13810604228638113, + "epoch": 8.85678704856787, + "grad_norm": 0.24571993947029114, + "learning_rate": 8.944223674675537e-06, + "loss": 0.07036117911338806, + "mean_token_accuracy": 0.9734892748296261, + "num_tokens": 8315235.0, + "step": 3560 + }, + { + "epoch": 8.85678704856787, + "eval_entropy": 0.23998506947658782, + "eval_loss": 0.9009848833084106, + "eval_mean_token_accuracy": 0.8521793619837872, + "eval_num_tokens": 8315235.0, + "eval_runtime": 86.0974, + "eval_samples_per_second": 15.97, + "eval_steps_per_second": 1.998, + "step": 3560 + }, + { + "entropy": 0.14193559321574867, + "epoch": 8.906600249066003, + "grad_norm": 0.17304112017154694, + "learning_rate": 8.194293432987386e-06, + "loss": 0.07077967524528503, + "mean_token_accuracy": 0.973305893689394, + "num_tokens": 8358099.0, + "step": 3580 + }, + { + "epoch": 8.906600249066003, + "eval_entropy": 0.23883876689644748, + "eval_loss": 0.9015622138977051, + "eval_mean_token_accuracy": 0.8524864378363587, + "eval_num_tokens": 8358099.0, + "eval_runtime": 86.0089, + "eval_samples_per_second": 15.987, + "eval_steps_per_second": 2.0, + "step": 3580 + }, + { + "entropy": 0.11878943420015275, + "epoch": 8.956413449564135, + "grad_norm": 0.19075658917427063, + "learning_rate": 7.476013303121426e-06, + "loss": 0.060806107521057126, + "mean_token_accuracy": 0.9776863709092141, + "num_tokens": 8407430.0, + "step": 3600 + }, + { + "epoch": 8.956413449564135, + "eval_entropy": 0.23726526309931, + "eval_loss": 0.9060276746749878, + "eval_mean_token_accuracy": 0.8524192058762838, + "eval_num_tokens": 8407430.0, + "eval_runtime": 85.7252, + "eval_samples_per_second": 16.04, + "eval_steps_per_second": 2.006, + "step": 3600 + }, + { + "entropy": 0.1255835090787747, + "epoch": 9.004981320049813, + "grad_norm": 0.11608047038316727, + "learning_rate": 6.78959990856799e-06, + "loss": 0.06319612860679627, + "mean_token_accuracy": 0.9766685519462976, + "num_tokens": 8453175.0, + "step": 3620 + }, + { + "epoch": 9.004981320049813, + "eval_entropy": 0.2373251837006835, + "eval_loss": 0.9045722484588623, + "eval_mean_token_accuracy": 0.8525558363559634, + "eval_num_tokens": 8453175.0, + "eval_runtime": 85.7435, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.006, + "step": 3620 + }, + { + "entropy": 0.12587778437882663, + "epoch": 9.054794520547945, + "grad_norm": 0.1564614623785019, + "learning_rate": 6.135260262244683e-06, + "loss": 0.0630365788936615, + "mean_token_accuracy": 0.9777486085891723, + "num_tokens": 8497151.0, + "step": 3640 + }, + { + "epoch": 9.054794520547945, + "eval_entropy": 0.23559923721260803, + "eval_loss": 0.9120694398880005, + "eval_mean_token_accuracy": 0.8525292966947999, + "eval_num_tokens": 8497151.0, + "eval_runtime": 85.8018, + "eval_samples_per_second": 16.025, + "eval_steps_per_second": 2.005, + "step": 3640 + }, + { + "entropy": 0.12535365503281354, + "epoch": 9.104607721046078, + "grad_norm": 0.1404249221086502, + "learning_rate": 5.513191704064086e-06, + "loss": 0.060502654314041136, + "mean_token_accuracy": 0.9770058333873749, + "num_tokens": 8542996.0, + "step": 3660 + }, + { + "epoch": 9.104607721046078, + "eval_entropy": 0.23525122691725575, + "eval_loss": 0.9182237982749939, + "eval_mean_token_accuracy": 0.8524098333924316, + "eval_num_tokens": 8542996.0, + "eval_runtime": 85.9872, + "eval_samples_per_second": 15.991, + "eval_steps_per_second": 2.0, + "step": 3660 + }, + { + "entropy": 0.11330419047735632, + "epoch": 9.15442092154421, + "grad_norm": 0.15513843297958374, + "learning_rate": 4.92358184141876e-06, + "loss": 0.05822383761405945, + "mean_token_accuracy": 0.9793384782969952, + "num_tokens": 8591625.0, + "step": 3680 + }, + { + "epoch": 9.15442092154421, + "eval_entropy": 0.2353947116711805, + "eval_loss": 0.9229223132133484, + "eval_mean_token_accuracy": 0.852500357253607, + "eval_num_tokens": 8591625.0, + "eval_runtime": 86.0805, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.998, + "step": 3680 + }, + { + "entropy": 0.11830627010203898, + "epoch": 9.204234122042342, + "grad_norm": 0.1730550080537796, + "learning_rate": 4.366608492601456e-06, + "loss": 0.05860854983329773, + "mean_token_accuracy": 0.9779663667082786, + "num_tokens": 8639845.0, + "step": 3700 + }, + { + "epoch": 9.204234122042342, + "eval_entropy": 0.23567205719476522, + "eval_loss": 0.9269373416900635, + "eval_mean_token_accuracy": 0.8523658004611038, + "eval_num_tokens": 8639845.0, + "eval_runtime": 85.9809, + "eval_samples_per_second": 15.992, + "eval_steps_per_second": 2.0, + "step": 3700 + }, + { + "entropy": 0.1180900705512613, + "epoch": 9.254047322540472, + "grad_norm": 0.20909737050533295, + "learning_rate": 3.842439633177387e-06, + "loss": 0.059438884258270264, + "mean_token_accuracy": 0.9786856278777123, + "num_tokens": 8687194.0, + "step": 3720 + }, + { + "epoch": 9.254047322540472, + "eval_entropy": 0.23602714493524196, + "eval_loss": 0.9293538928031921, + "eval_mean_token_accuracy": 0.8523273440294488, + "eval_num_tokens": 8687194.0, + "eval_runtime": 85.2118, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.019, + "step": 3720 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.6676630596618854e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3740/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3740/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3740/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3740/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3740/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3740/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3740/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3740/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3740/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3740/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3740/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3740/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3740/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3740/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..24dd6c7932d1ed12cf45dc50955b9125d68e65de --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3740/trainer_state.json @@ -0,0 +1,3961 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 9.303860523038605, + "eval_steps": 20, + "global_step": 3740, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + }, + { + "entropy": 0.561330484598875, + "epoch": 1.891656288916563, + "grad_norm": 0.6722865700721741, + "learning_rate": 0.0002208867897174789, + "loss": 0.499837589263916, + "mean_token_accuracy": 0.8518734864890576, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.5865232653396074, + "eval_loss": 0.5437926650047302, + "eval_mean_token_accuracy": 0.8450997017843779, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4116, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.547389242425561, + "epoch": 1.9414694894146949, + "grad_norm": 0.7935577034950256, + "learning_rate": 0.00022027119820226907, + "loss": 0.4977591514587402, + "mean_token_accuracy": 0.8539491161704064, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.5290903090391048, + "eval_loss": 0.5409526824951172, + "eval_mean_token_accuracy": 0.8497545698354411, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.7262, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 780 + }, + { + "entropy": 0.5687909748405218, + "epoch": 1.9912826899128269, + "grad_norm": 0.6180546283721924, + "learning_rate": 0.00021962329729698345, + "loss": 0.5109643459320068, + "mean_token_accuracy": 0.8521598495543004, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.5503541858390321, + "eval_loss": 0.5361555218696594, + "eval_mean_token_accuracy": 0.8510884285666221, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.3339, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 800 + }, + { + "entropy": 0.4739728841261986, + "epoch": 2.0398505603985058, + "grad_norm": 0.8058829307556152, + "learning_rate": 0.0002189432823996982, + "loss": 0.4204097747802734, + "mean_token_accuracy": 0.8728981889211215, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.5077334992414297, + "eval_loss": 0.5531114339828491, + "eval_mean_token_accuracy": 0.8489257208136625, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.4801, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.989, + "step": 820 + }, + { + "entropy": 0.4594309840351343, + "epoch": 2.0896637608966375, + "grad_norm": 0.6906896829605103, + "learning_rate": 0.0002182313585936314, + "loss": 0.4071959495544434, + "mean_token_accuracy": 0.8732857562601566, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.49850136994622474, + "eval_loss": 0.5486204624176025, + "eval_mean_token_accuracy": 0.8507991450470548, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.3364, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.4881629109382629, + "epoch": 2.1394769613947697, + "grad_norm": 0.6343470215797424, + "learning_rate": 0.0002174877405852928, + "loss": 0.41669540405273436, + "mean_token_accuracy": 0.8711295068264008, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.49155513924914734, + "eval_loss": 0.555109441280365, + "eval_mean_token_accuracy": 0.8496399400539176, + "eval_num_tokens": 2008562.0, + "eval_runtime": 86.3295, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 860 + }, + { + "entropy": 0.4648668970912695, + "epoch": 2.1892901618929015, + "grad_norm": 0.8014165163040161, + "learning_rate": 0.00021671265263973133, + "loss": 0.4110250473022461, + "mean_token_accuracy": 0.8754166305065155, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.4909258722219356, + "eval_loss": 0.5539511442184448, + "eval_mean_token_accuracy": 0.8492401502160138, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.3468, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 880 + }, + { + "entropy": 0.4824485514312983, + "epoch": 2.2391033623910337, + "grad_norm": 0.6665191054344177, + "learning_rate": 0.00021590632851289967, + "loss": 0.4181404113769531, + "mean_token_accuracy": 0.8726993151009083, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.4986876940657926, + "eval_loss": 0.547695517539978, + "eval_mean_token_accuracy": 0.8501384708770486, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.3838, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 900 + }, + { + "entropy": 0.4751896943897009, + "epoch": 2.2889165628891655, + "grad_norm": 0.81158047914505, + "learning_rate": 0.00021506901138115678, + "loss": 0.40689678192138673, + "mean_token_accuracy": 0.8745221219956875, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.507153491121392, + "eval_loss": 0.5501641631126404, + "eval_mean_token_accuracy": 0.8495670116918032, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.0912, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 920 + }, + { + "entropy": 0.4873133715242147, + "epoch": 2.3387297633872977, + "grad_norm": 0.7218056321144104, + "learning_rate": 0.0002142009537679292, + "loss": 0.42701358795166017, + "mean_token_accuracy": 0.8695114746689796, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5202612736543943, + "eval_loss": 0.5491839051246643, + "eval_mean_token_accuracy": 0.8494071208460386, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.1142, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 940 + }, + { + "entropy": 0.4762951169162989, + "epoch": 2.3885429638854294, + "grad_norm": 0.7194424867630005, + "learning_rate": 0.0002133024174675534, + "loss": 0.42299847602844237, + "mean_token_accuracy": 0.8709790132939815, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4899340462546016, + "eval_loss": 0.5522511601448059, + "eval_mean_token_accuracy": 0.8492208258357159, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.463, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 960 + }, + { + "entropy": 0.49650347977876663, + "epoch": 2.4383561643835616, + "grad_norm": 0.8406022787094116, + "learning_rate": 0.0002123736734663221, + "loss": 0.4275330066680908, + "mean_token_accuracy": 0.8670595556497573, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.49691385654515996, + "eval_loss": 0.5491269826889038, + "eval_mean_token_accuracy": 0.850309816210769, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.17, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 980 + }, + { + "entropy": 0.48843890577554705, + "epoch": 2.488169364881694, + "grad_norm": 0.9082473516464233, + "learning_rate": 0.00021141500186075868, + "loss": 0.4309722423553467, + "mean_token_accuracy": 0.8686766296625137, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5543508351195691, + "eval_loss": 0.5478800535202026, + "eval_mean_token_accuracy": 0.8478029522784921, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.3835, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 1000 + }, + { + "entropy": 0.4777219031006098, + "epoch": 2.5379825653798256, + "grad_norm": 0.7448089122772217, + "learning_rate": 0.0002104266917731438, + "loss": 0.423325252532959, + "mean_token_accuracy": 0.8706337086856365, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.49857561550168106, + "eval_loss": 0.5511948466300964, + "eval_mean_token_accuracy": 0.8502220289651737, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.5399, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.988, + "step": 1020 + }, + { + "entropy": 0.4844174191355705, + "epoch": 2.587795765877958, + "grad_norm": 0.794029176235199, + "learning_rate": 0.00020940904126432, + "loss": 0.4176753044128418, + "mean_token_accuracy": 0.873535567522049, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.485467542222766, + "eval_loss": 0.5539286732673645, + "eval_mean_token_accuracy": 0.8495475081510322, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.135, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 1.997, + "step": 1040 + }, + { + "entropy": 0.49070929251611234, + "epoch": 2.6376089663760895, + "grad_norm": 0.7558256983757019, + "learning_rate": 0.0002083623572438007, + "loss": 0.42867293357849123, + "mean_token_accuracy": 0.8696666076779366, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.490822730889154, + "eval_loss": 0.5434785485267639, + "eval_mean_token_accuracy": 0.850568296950917, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.4933, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 1060 + }, + { + "entropy": 0.47806114703416824, + "epoch": 2.6874221668742218, + "grad_norm": 0.6608979105949402, + "learning_rate": 0.00020728695537721047, + "loss": 0.4289727687835693, + "mean_token_accuracy": 0.8693130135536193, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.5285773256490397, + "eval_loss": 0.5444230437278748, + "eval_mean_token_accuracy": 0.8498796481032704, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.7091, + "eval_samples_per_second": 15.858, + "eval_steps_per_second": 1.984, + "step": 1080 + }, + { + "entropy": 0.5046216730028391, + "epoch": 2.7372353673723535, + "grad_norm": 0.8428544998168945, + "learning_rate": 0.00020618315999108454, + "loss": 0.43131070137023925, + "mean_token_accuracy": 0.8701941035687923, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.49888394738352576, + "eval_loss": 0.5459766387939453, + "eval_mean_token_accuracy": 0.8511758872935938, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.2222, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.995, + "step": 1100 + }, + { + "entropy": 0.5212558470666409, + "epoch": 2.7870485678704857, + "grad_norm": 1.129318118095398, + "learning_rate": 0.00020505130397505635, + "loss": 0.44249300956726073, + "mean_token_accuracy": 0.8654101334512234, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5179622324053631, + "eval_loss": 0.5522801280021667, + "eval_mean_token_accuracy": 0.8497019947268242, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.1903, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.996, + "step": 1120 + }, + { + "entropy": 0.4988406613469124, + "epoch": 2.8368617683686175, + "grad_norm": 0.6460545063018799, + "learning_rate": 0.00020389172868146263, + "loss": 0.4386270523071289, + "mean_token_accuracy": 0.8690383620560169, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.5042278484203094, + "eval_loss": 0.5433034300804138, + "eval_mean_token_accuracy": 0.8497674451317898, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.3028, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.993, + "step": 1140 + }, + { + "entropy": 0.4926559619605541, + "epoch": 2.8866749688667497, + "grad_norm": 0.8199329972267151, + "learning_rate": 0.00020270478382239615, + "loss": 0.4313485145568848, + "mean_token_accuracy": 0.8674727231264114, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.503873193160046, + "eval_loss": 0.5388111472129822, + "eval_mean_token_accuracy": 0.8526195034731266, + "eval_num_tokens": 2710196.0, + "eval_runtime": 86.4054, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.991, + "step": 1160 + }, + { + "entropy": 0.5020013231784105, + "epoch": 2.936488169364882, + "grad_norm": 0.7344821095466614, + "learning_rate": 0.00020149082736423723, + "loss": 0.43590536117553713, + "mean_token_accuracy": 0.8671772189438343, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5368241809828337, + "eval_loss": 0.5355703830718994, + "eval_mean_token_accuracy": 0.8517617773871089, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.2945, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1180 + }, + { + "entropy": 0.5112275708466768, + "epoch": 2.9863013698630136, + "grad_norm": 0.6951606869697571, + "learning_rate": 0.00020025022541969622, + "loss": 0.43579301834106443, + "mean_token_accuracy": 0.8641206480562686, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.5066795706055885, + "eval_loss": 0.5415249466896057, + "eval_mean_token_accuracy": 0.8493563373421513, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.5005, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.988, + "step": 1200 + }, + { + "entropy": 0.42298635305502474, + "epoch": 3.0348692403486925, + "grad_norm": 0.8201794028282166, + "learning_rate": 0.00019898335213739863, + "loss": 0.35593905448913576, + "mean_token_accuracy": 0.889238600547497, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.4584170470750609, + "eval_loss": 0.569487452507019, + "eval_mean_token_accuracy": 0.8495814173027526, + "eval_num_tokens": 2848509.0, + "eval_runtime": 86.2281, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 1220 + }, + { + "entropy": 0.37450140453875064, + "epoch": 3.0846824408468243, + "grad_norm": 0.7308394908905029, + "learning_rate": 0.0001976905895890471, + "loss": 0.307823920249939, + "mean_token_accuracy": 0.9001288741827012, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.45185995916294497, + "eval_loss": 0.5672881603240967, + "eval_mean_token_accuracy": 0.8511318519364955, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.0819, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.998, + "step": 1240 + }, + { + "entropy": 0.3887945845723152, + "epoch": 3.1344956413449565, + "grad_norm": 0.7299330830574036, + "learning_rate": 0.0001963723276541939, + "loss": 0.32047903537750244, + "mean_token_accuracy": 0.8960984498262405, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.44865354549053105, + "eval_loss": 0.5666037201881409, + "eval_mean_token_accuracy": 0.8496572649063066, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 1260 + }, + { + "entropy": 0.39677664265036583, + "epoch": 3.1843088418430883, + "grad_norm": 0.9533219933509827, + "learning_rate": 0.00019502896390265838, + "loss": 0.3253983497619629, + "mean_token_accuracy": 0.8964207418262958, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.4641980809527774, + "eval_loss": 0.5814996957778931, + "eval_mean_token_accuracy": 0.8485886212005171, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.7784, + "eval_samples_per_second": 15.845, + "eval_steps_per_second": 1.982, + "step": 1280 + }, + { + "entropy": 0.39210722744464876, + "epoch": 3.2341220423412205, + "grad_norm": 0.7447651028633118, + "learning_rate": 0.00019366090347462545, + "loss": 0.3276803970336914, + "mean_token_accuracy": 0.8930055953562259, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43595615254585135, + "eval_loss": 0.5722188353538513, + "eval_mean_token_accuracy": 0.8501105755567551, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.5271, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 1300 + }, + { + "entropy": 0.3684127271175385, + "epoch": 3.2839352428393527, + "grad_norm": 0.6934201121330261, + "learning_rate": 0.00019226855895846078, + "loss": 0.3156379222869873, + "mean_token_accuracy": 0.8976306475698947, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.4628148723480313, + "eval_loss": 0.5631352066993713, + "eval_mean_token_accuracy": 0.8504934813394103, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.3436, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 1320 + }, + { + "entropy": 0.4073401909321547, + "epoch": 3.3337484433374844, + "grad_norm": 0.9386897683143616, + "learning_rate": 0.00019085235026627994, + "loss": 0.34265310764312745, + "mean_token_accuracy": 0.8902062118053437, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.46455050623694133, + "eval_loss": 0.5586736798286438, + "eval_mean_token_accuracy": 0.8506874702004499, + "eval_num_tokens": 3132874.0, + "eval_runtime": 86.1286, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.997, + "step": 1340 + }, + { + "entropy": 0.4046429242938757, + "epoch": 3.383561643835616, + "grad_norm": 0.9633992314338684, + "learning_rate": 0.00018941270450730836, + "loss": 0.33816893100738527, + "mean_token_accuracy": 0.8927541889250279, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.46846531660750856, + "eval_loss": 0.561501681804657, + "eval_mean_token_accuracy": 0.8496256377114806, + "eval_num_tokens": 3178055.0, + "eval_runtime": 86.685, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1360 + }, + { + "entropy": 0.39872407019138334, + "epoch": 3.4333748443337484, + "grad_norm": 0.7786458730697632, + "learning_rate": 0.00018795005585907113, + "loss": 0.33342490196228025, + "mean_token_accuracy": 0.8944805048406124, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.42709505973860273, + "eval_loss": 0.5751848220825195, + "eval_mean_token_accuracy": 0.8507290447867194, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.6892, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 1380 + }, + { + "entropy": 0.3923338124528527, + "epoch": 3.4831880448318806, + "grad_norm": 0.9305956363677979, + "learning_rate": 0.0001864648454364511, + "loss": 0.33188116550445557, + "mean_token_accuracy": 0.8943330392241478, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.4386174779298694, + "eval_loss": 0.5680831074714661, + "eval_mean_token_accuracy": 0.8513129727784977, + "eval_num_tokens": 3274096.0, + "eval_runtime": 86.2671, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 1400 + }, + { + "entropy": 0.3856233984231949, + "epoch": 3.5330012453300124, + "grad_norm": 1.0362752676010132, + "learning_rate": 0.0001849575211586545, + "loss": 0.33098697662353516, + "mean_token_accuracy": 0.8961390435695649, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4574795474493226, + "eval_loss": 0.5630439519882202, + "eval_mean_token_accuracy": 0.8520988873964133, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.6035, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 1420 + }, + { + "entropy": 0.39812871962785723, + "epoch": 3.5828144458281446, + "grad_norm": 0.7807195782661438, + "learning_rate": 0.0001834285376141247, + "loss": 0.3333771228790283, + "mean_token_accuracy": 0.8930827379226685, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.4556825893909432, + "eval_loss": 0.5689062476158142, + "eval_mean_token_accuracy": 0.8507103507601937, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.1606, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.996, + "step": 1440 + }, + { + "entropy": 0.4147744856774807, + "epoch": 3.6326276463262763, + "grad_norm": 0.6429352164268494, + "learning_rate": 0.00018187835592344443, + "loss": 0.3482560873031616, + "mean_token_accuracy": 0.8910200245678425, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.46600024540757023, + "eval_loss": 0.5609709024429321, + "eval_mean_token_accuracy": 0.8491220876227977, + "eval_num_tokens": 3415600.0, + "eval_runtime": 86.8039, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1460 + }, + { + "entropy": 0.40425071083009245, + "epoch": 3.6824408468244085, + "grad_norm": 0.8613698482513428, + "learning_rate": 0.0001803074436002682, + "loss": 0.342916464805603, + "mean_token_accuracy": 0.8916418336331844, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.43855057899342026, + "eval_loss": 0.5720968246459961, + "eval_mean_token_accuracy": 0.8500823641932288, + "eval_num_tokens": 3460471.0, + "eval_runtime": 86.6746, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1480 + }, + { + "entropy": 0.39465143866837027, + "epoch": 3.7322540473225407, + "grad_norm": 0.6285189986228943, + "learning_rate": 0.0001787162744103265, + "loss": 0.3424591779708862, + "mean_token_accuracy": 0.8906558901071548, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4509461877304454, + "eval_loss": 0.5590082406997681, + "eval_mean_token_accuracy": 0.8511747371318729, + "eval_num_tokens": 3507647.0, + "eval_runtime": 86.8126, + "eval_samples_per_second": 15.839, + "eval_steps_per_second": 1.981, + "step": 1500 + }, + { + "entropy": 0.4021005939692259, + "epoch": 3.7820672478206725, + "grad_norm": 0.8821248412132263, + "learning_rate": 0.00017710532822854468, + "loss": 0.3462103843688965, + "mean_token_accuracy": 0.889109355956316, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.4502199075596277, + "eval_loss": 0.566046416759491, + "eval_mean_token_accuracy": 0.8501714208098345, + "eval_num_tokens": 3548934.0, + "eval_runtime": 86.8336, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.981, + "step": 1520 + }, + { + "entropy": 0.4017397932708263, + "epoch": 3.8318804483188043, + "grad_norm": 0.8400952816009521, + "learning_rate": 0.0001754750908943189, + "loss": 0.34890995025634763, + "mean_token_accuracy": 0.8892098367214203, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.4614003023435903, + "eval_loss": 0.5617933869361877, + "eval_mean_token_accuracy": 0.8515863616106122, + "eval_num_tokens": 3597186.0, + "eval_runtime": 86.4609, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 1540 + }, + { + "entropy": 0.4112051840871572, + "epoch": 3.8816936488169365, + "grad_norm": 0.769478440284729, + "learning_rate": 0.0001738260540649939, + "loss": 0.34711437225341796, + "mean_token_accuracy": 0.8911717928946018, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4540443811998811, + "eval_loss": 0.5576469898223877, + "eval_mean_token_accuracy": 0.8512079674144124, + "eval_num_tokens": 3646646.0, + "eval_runtime": 86.5103, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 1560 + }, + { + "entropy": 0.41105241514742374, + "epoch": 3.9315068493150687, + "grad_norm": 0.8468427062034607, + "learning_rate": 0.00017215871506758568, + "loss": 0.3433023452758789, + "mean_token_accuracy": 0.8898739732801915, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.4707539707075718, + "eval_loss": 0.5641466379165649, + "eval_mean_token_accuracy": 0.8495440957851188, + "eval_num_tokens": 3689560.0, + "eval_runtime": 86.609, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.986, + "step": 1580 + }, + { + "entropy": 0.41016379147768023, + "epoch": 3.9813200498132004, + "grad_norm": 0.7482675313949585, + "learning_rate": 0.0001704735767487946, + "loss": 0.34550890922546384, + "mean_token_accuracy": 0.8893028847873211, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.46391099864660307, + "eval_loss": 0.5593640804290771, + "eval_mean_token_accuracy": 0.8510130581467651, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.3975, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 1600 + }, + { + "entropy": 0.33167599791135544, + "epoch": 4.029887920298879, + "grad_norm": 0.9435692429542542, + "learning_rate": 0.00016877114732335337, + "loss": 0.2716026544570923, + "mean_token_accuracy": 0.9133149828666296, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.38499350005457567, + "eval_loss": 0.6298249363899231, + "eval_mean_token_accuracy": 0.8488117071778275, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.2933, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1620 + }, + { + "entropy": 0.3000166634097695, + "epoch": 4.0797011207970115, + "grad_norm": 0.8080845475196838, + "learning_rate": 0.0001670519402207569, + "loss": 0.22617182731628419, + "mean_token_accuracy": 0.9253474645316601, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.370110988703578, + "eval_loss": 0.6338461637496948, + "eval_mean_token_accuracy": 0.8485634801692741, + "eval_num_tokens": 3828830.0, + "eval_runtime": 85.9508, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.001, + "step": 1640 + }, + { + "entropy": 0.2986910421401262, + "epoch": 4.129514321295143, + "grad_norm": 0.7310900092124939, + "learning_rate": 0.0001653164739304185, + "loss": 0.22367463111877442, + "mean_token_accuracy": 0.9252275295555592, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.3944379702037157, + "eval_loss": 0.6109381914138794, + "eval_mean_token_accuracy": 0.849291454220927, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.6728, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1660 + }, + { + "entropy": 0.3095553796738386, + "epoch": 4.179327521793275, + "grad_norm": 0.7059140801429749, + "learning_rate": 0.0001635652718453007, + "loss": 0.23651680946350098, + "mean_token_accuracy": 0.9208931416273117, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.3910588648949945, + "eval_loss": 0.6104469299316406, + "eval_mean_token_accuracy": 0.8486883893262508, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7612, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.982, + "step": 1680 + }, + { + "entropy": 0.3001101028174162, + "epoch": 4.229140722291407, + "grad_norm": 0.6787802577018738, + "learning_rate": 0.00016179886210406728, + "loss": 0.23130471706390382, + "mean_token_accuracy": 0.9233332790434361, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3794369170832079, + "eval_loss": 0.6182110905647278, + "eval_mean_token_accuracy": 0.8495433777570724, + "eval_num_tokens": 3967474.0, + "eval_runtime": 85.94, + "eval_samples_per_second": 16.0, + "eval_steps_per_second": 2.001, + "step": 1700 + }, + { + "entropy": 0.3031421799212694, + "epoch": 4.2789539227895395, + "grad_norm": 0.9732038378715515, + "learning_rate": 0.0001600177774318036, + "loss": 0.2359529733657837, + "mean_token_accuracy": 0.9217648565769195, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3923123094231583, + "eval_loss": 0.6057384610176086, + "eval_mean_token_accuracy": 0.8508818288182103, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7647, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.29365369994193313, + "epoch": 4.328767123287671, + "grad_norm": 0.7681498527526855, + "learning_rate": 0.0001582225549793541, + "loss": 0.2269371747970581, + "mean_token_accuracy": 0.9245341829955578, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.4011661055129628, + "eval_loss": 0.6144486665725708, + "eval_mean_token_accuracy": 0.8480324357054955, + "eval_num_tokens": 4062594.0, + "eval_runtime": 87.1306, + "eval_samples_per_second": 15.781, + "eval_steps_per_second": 1.974, + "step": 1740 + }, + { + "entropy": 0.29396994728595016, + "epoch": 4.378580323785803, + "grad_norm": 1.0001007318496704, + "learning_rate": 0.0001564137361613248, + "loss": 0.22777395248413085, + "mean_token_accuracy": 0.9262309700250626, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38518730195802314, + "eval_loss": 0.6202630400657654, + "eval_mean_token_accuracy": 0.8493869807137999, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6616, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.3096018506214023, + "epoch": 4.428393524283935, + "grad_norm": 1.0448365211486816, + "learning_rate": 0.00015459186649280024, + "loss": 0.23696351051330566, + "mean_token_accuracy": 0.9217322513461113, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.3946371126140273, + "eval_loss": 0.6079026460647583, + "eval_mean_token_accuracy": 0.8492515852978063, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6582, + "eval_samples_per_second": 15.867, + "eval_steps_per_second": 1.985, + "step": 1780 + }, + { + "entropy": 0.32619857545942066, + "epoch": 4.478206724782067, + "grad_norm": 0.7210651636123657, + "learning_rate": 0.00015275749542482337, + "loss": 0.24651215076446534, + "mean_token_accuracy": 0.9177676141262054, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.3947690814560236, + "eval_loss": 0.6065912246704102, + "eval_mean_token_accuracy": 0.8502957744653835, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.5959, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.986, + "step": 1800 + }, + { + "entropy": 0.3193941755220294, + "epoch": 4.5280199252802, + "grad_norm": 0.8281906843185425, + "learning_rate": 0.0001509111761786888, + "loss": 0.23936262130737304, + "mean_token_accuracy": 0.9201708927750587, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38704028864239537, + "eval_loss": 0.6006569266319275, + "eval_mean_token_accuracy": 0.8502406720505205, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.8059, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1820 + }, + { + "entropy": 0.3164879363030195, + "epoch": 4.577833125778331, + "grad_norm": 0.7892968654632568, + "learning_rate": 0.00014905346557909867, + "loss": 0.24541733264923096, + "mean_token_accuracy": 0.9175932116806507, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.38861122120951497, + "eval_loss": 0.6115967631340027, + "eval_mean_token_accuracy": 0.849471275196519, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.2946, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1840 + }, + { + "entropy": 0.3051785985007882, + "epoch": 4.627646326276463, + "grad_norm": 0.8109654188156128, + "learning_rate": 0.0001471849238862319, + "loss": 0.23433220386505127, + "mean_token_accuracy": 0.9206570319831371, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.37162452295076015, + "eval_loss": 0.6184061765670776, + "eval_mean_token_accuracy": 0.8501173268223918, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.6865, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1860 + }, + { + "entropy": 0.3168198253959417, + "epoch": 4.677459526774595, + "grad_norm": 0.9512342214584351, + "learning_rate": 0.0001453061146267775, + "loss": 0.23832404613494873, + "mean_token_accuracy": 0.9197044663131237, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3845940856912801, + "eval_loss": 0.606762707233429, + "eval_mean_token_accuracy": 0.8504838194957999, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.5175, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 1880 + }, + { + "entropy": 0.30791807882487776, + "epoch": 4.7272727272727275, + "grad_norm": 0.8123113512992859, + "learning_rate": 0.00014341760442398248, + "loss": 0.2395785331726074, + "mean_token_accuracy": 0.918928150832653, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.39762327222283494, + "eval_loss": 0.5994202494621277, + "eval_mean_token_accuracy": 0.8509274201337681, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.2873, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.993, + "step": 1900 + }, + { + "entropy": 0.3021434534341097, + "epoch": 4.777085927770859, + "grad_norm": 0.731787383556366, + "learning_rate": 0.000141519962826766, + "loss": 0.23494718074798585, + "mean_token_accuracy": 0.9201403826475143, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.3827026732439219, + "eval_loss": 0.5995895862579346, + "eval_mean_token_accuracy": 0.851468373523202, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.3006, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 1920 + }, + { + "entropy": 0.31626159623265265, + "epoch": 4.826899128268991, + "grad_norm": 0.8848487138748169, + "learning_rate": 0.00013961376213795132, + "loss": 0.2439030647277832, + "mean_token_accuracy": 0.9196575872600079, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.388698436839636, + "eval_loss": 0.6000174283981323, + "eval_mean_token_accuracy": 0.8518068187458571, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.8979, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.979, + "step": 1940 + }, + { + "entropy": 0.30520407035946845, + "epoch": 4.876712328767123, + "grad_norm": 0.8532460927963257, + "learning_rate": 0.00013769957724166695, + "loss": 0.23458616733551024, + "mean_token_accuracy": 0.9221912942826748, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.38777847102908203, + "eval_loss": 0.6004981398582458, + "eval_mean_token_accuracy": 0.8516481768253238, + "eval_num_tokens": 4578167.0, + "eval_runtime": 87.0777, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.975, + "step": 1960 + }, + { + "entropy": 0.3226448342204094, + "epoch": 4.926525529265255, + "grad_norm": 0.6945561766624451, + "learning_rate": 0.0001357779854299694, + "loss": 0.24048397541046143, + "mean_token_accuracy": 0.9195300146937371, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.38581624263247777, + "eval_loss": 0.6029234528541565, + "eval_mean_token_accuracy": 0.8514213260523108, + "eval_num_tokens": 4622316.0, + "eval_runtime": 85.8729, + "eval_samples_per_second": 16.012, + "eval_steps_per_second": 2.003, + "step": 1980 + }, + { + "entropy": 0.3051655298098922, + "epoch": 4.976338729763388, + "grad_norm": 0.7976452708244324, + "learning_rate": 0.00013384956622874001, + "loss": 0.23584742546081544, + "mean_token_accuracy": 0.9216851457953453, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.37913159246361533, + "eval_loss": 0.6057604551315308, + "eval_mean_token_accuracy": 0.8525801203971686, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.1145, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 2000 + }, + { + "entropy": 0.27438195240803254, + "epoch": 5.024906600249066, + "grad_norm": 0.6729586124420166, + "learning_rate": 0.0001319149012229075, + "loss": 0.19775952100753785, + "mean_token_accuracy": 0.9339428559327737, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.3448961910813354, + "eval_loss": 0.6750120520591736, + "eval_mean_token_accuracy": 0.8487970232963562, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.1169, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 2020 + }, + { + "entropy": 0.21423916313797237, + "epoch": 5.074719800747198, + "grad_norm": 0.6934391856193542, + "learning_rate": 0.00012997457388105022, + "loss": 0.1439570426940918, + "mean_token_accuracy": 0.9528236843645572, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.3570949243771475, + "eval_loss": 0.6465504169464111, + "eval_mean_token_accuracy": 0.8490785547467166, + "eval_num_tokens": 4763269.0, + "eval_runtime": 85.9574, + "eval_samples_per_second": 15.996, + "eval_steps_per_second": 2.001, + "step": 2040 + }, + { + "entropy": 0.20838565267622472, + "epoch": 5.12453300124533, + "grad_norm": 0.7286986112594604, + "learning_rate": 0.00012802916937942972, + "loss": 0.14467307329177856, + "mean_token_accuracy": 0.950994835793972, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.3452463157821533, + "eval_loss": 0.6705958843231201, + "eval_mean_token_accuracy": 0.8490352796953778, + "eval_num_tokens": 4809047.0, + "eval_runtime": 86.228, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 2060 + }, + { + "entropy": 0.20453082229942082, + "epoch": 5.174346201743462, + "grad_norm": 0.7515555620193481, + "learning_rate": 0.00012607927442550974, + "loss": 0.13732000589370727, + "mean_token_accuracy": 0.9537357829511166, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.32431264914745506, + "eval_loss": 0.6743043065071106, + "eval_mean_token_accuracy": 0.8504878629085629, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.5948, + "eval_samples_per_second": 15.879, + "eval_steps_per_second": 1.986, + "step": 2080 + }, + { + "entropy": 0.21812320686876774, + "epoch": 5.224159402241594, + "grad_norm": 0.9093465209007263, + "learning_rate": 0.0001241254770810132, + "loss": 0.14311420917510986, + "mean_token_accuracy": 0.9514068141579628, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.33086285835435225, + "eval_loss": 0.6676449179649353, + "eval_mean_token_accuracy": 0.8505287662495015, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 2100 + }, + { + "entropy": 0.2180163251236081, + "epoch": 5.273972602739726, + "grad_norm": 0.6703007221221924, + "learning_rate": 0.00012216836658457075, + "loss": 0.14803968667984008, + "mean_token_accuracy": 0.9521303348243236, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.33162341708707255, + "eval_loss": 0.6658875942230225, + "eval_mean_token_accuracy": 0.8500757605530495, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.6296, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 2120 + }, + { + "entropy": 0.22511130161583423, + "epoch": 5.323785803237858, + "grad_norm": 0.8078880906105042, + "learning_rate": 0.00012020853317401455, + "loss": 0.15228408575057983, + "mean_token_accuracy": 0.947144789993763, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3354601170434508, + "eval_loss": 0.6677829623222351, + "eval_mean_token_accuracy": 0.8482600024273229, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.4689, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.989, + "step": 2140 + }, + { + "entropy": 0.2244176059961319, + "epoch": 5.37359900373599, + "grad_norm": 0.9636075496673584, + "learning_rate": 0.00011824656790837037, + "loss": 0.15260883569717407, + "mean_token_accuracy": 0.9471467643976211, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.3381616926297199, + "eval_loss": 0.6694412231445312, + "eval_mean_token_accuracy": 0.8482369603805764, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.4147, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 2160 + }, + { + "entropy": 0.22982364390045404, + "epoch": 5.423412204234122, + "grad_norm": 0.775401771068573, + "learning_rate": 0.00011628306248960262, + "loss": 0.15140302181243898, + "mean_token_accuracy": 0.9492553934454918, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.3305150235808173, + "eval_loss": 0.6717822551727295, + "eval_mean_token_accuracy": 0.8489849723355715, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.4728, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.989, + "step": 2180 + }, + { + "entropy": 0.21448935717344284, + "epoch": 5.473225404732254, + "grad_norm": 0.6575281023979187, + "learning_rate": 0.00011431860908416465, + "loss": 0.1452319622039795, + "mean_token_accuracy": 0.9505287684500218, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3488145174328671, + "eval_loss": 0.6612305641174316, + "eval_mean_token_accuracy": 0.8492907808963642, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6927, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 2200 + }, + { + "entropy": 0.23091202937066554, + "epoch": 5.523038605230386, + "grad_norm": 0.8909686207771301, + "learning_rate": 0.00011235380014440985, + "loss": 0.15150139331817628, + "mean_token_accuracy": 0.9497875183820724, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.3268539015810157, + "eval_loss": 0.6667542457580566, + "eval_mean_token_accuracy": 0.8499062903398691, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.4644, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 2220 + }, + { + "entropy": 0.2227974807843566, + "epoch": 5.572851805728518, + "grad_norm": 0.6180275082588196, + "learning_rate": 0.0001103892282299158, + "loss": 0.1491069197654724, + "mean_token_accuracy": 0.9488144010305405, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3346347655494546, + "eval_loss": 0.6665948629379272, + "eval_mean_token_accuracy": 0.8499961893918903, + "eval_num_tokens": 5226864.0, + "eval_runtime": 87.0548, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.976, + "step": 2240 + }, + { + "entropy": 0.21368421968072654, + "epoch": 5.62266500622665, + "grad_norm": 0.6004369258880615, + "learning_rate": 0.00010842548582877651, + "loss": 0.14485255479812623, + "mean_token_accuracy": 0.9502056457102299, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.32753298804163933, + "eval_loss": 0.6680151224136353, + "eval_mean_token_accuracy": 0.8515451086121936, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.8524, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.98, + "step": 2260 + }, + { + "entropy": 0.2103635374456644, + "epoch": 5.672478206724782, + "grad_norm": 0.699174702167511, + "learning_rate": 0.00010646316517891613, + "loss": 0.14297772645950318, + "mean_token_accuracy": 0.9512537539005279, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.32966585959806, + "eval_loss": 0.675578773021698, + "eval_mean_token_accuracy": 0.8509623023659684, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.4518, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.99, + "step": 2280 + }, + { + "entropy": 0.22516900151968003, + "epoch": 5.722291407222914, + "grad_norm": 0.6637354493141174, + "learning_rate": 0.00010450285808947797, + "loss": 0.15202572345733642, + "mean_token_accuracy": 0.9482452072203159, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3369456917740578, + "eval_loss": 0.6697061061859131, + "eval_mean_token_accuracy": 0.848603522361711, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.6371, + "eval_samples_per_second": 15.871, + "eval_steps_per_second": 1.985, + "step": 2300 + }, + { + "entropy": 0.21841065725311637, + "epoch": 5.772104607721046, + "grad_norm": 0.7940268516540527, + "learning_rate": 0.00010254515576234297, + "loss": 0.14710167646408082, + "mean_token_accuracy": 0.9493498183786869, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3237486180177955, + "eval_loss": 0.6779657602310181, + "eval_mean_token_accuracy": 0.8500715313955794, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.1826, + "eval_samples_per_second": 15.954, + "eval_steps_per_second": 1.996, + "step": 2320 + }, + { + "entropy": 0.22146204356104135, + "epoch": 5.821917808219178, + "grad_norm": 0.9234833121299744, + "learning_rate": 0.00010059064861383132, + "loss": 0.14720046520233154, + "mean_token_accuracy": 0.9493872679769992, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.32365207564692167, + "eval_loss": 0.6704005002975464, + "eval_mean_token_accuracy": 0.8507985760306203, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.5494, + "eval_samples_per_second": 15.887, + "eval_steps_per_second": 1.987, + "step": 2340 + }, + { + "entropy": 0.20934011954814197, + "epoch": 5.87173100871731, + "grad_norm": 0.5547503232955933, + "learning_rate": 9.863992609664084e-05, + "loss": 0.1464867353439331, + "mean_token_accuracy": 0.9503875687718392, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.3330401429083458, + "eval_loss": 0.6659091114997864, + "eval_mean_token_accuracy": 0.8504848906467127, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.5855, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 2360 + }, + { + "entropy": 0.21678635366261007, + "epoch": 5.921544209215442, + "grad_norm": 0.570612907409668, + "learning_rate": 9.669357652207635e-05, + "loss": 0.14821385145187377, + "mean_token_accuracy": 0.9503940217196941, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3322022325077722, + "eval_loss": 0.6722489595413208, + "eval_mean_token_accuracy": 0.8489979422369669, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.2986, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 2380 + }, + { + "entropy": 0.20932920072227718, + "epoch": 5.971357409713574, + "grad_norm": 0.7879557609558105, + "learning_rate": 9.475218688262262e-05, + "loss": 0.14675841331481934, + "mean_token_accuracy": 0.9507176131010056, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.3199348642902319, + "eval_loss": 0.6698136329650879, + "eval_mean_token_accuracy": 0.8514142130003419, + "eval_num_tokens": 5605400.0, + "eval_runtime": 85.8995, + "eval_samples_per_second": 16.007, + "eval_steps_per_second": 2.002, + "step": 2400 + }, + { + "entropy": 0.21032143919131693, + "epoch": 6.019925280199253, + "grad_norm": 0.5823076367378235, + "learning_rate": 9.281634267491569e-05, + "loss": 0.13322267532348633, + "mean_token_accuracy": 0.9550939072401096, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.30206270117399303, + "eval_loss": 0.7093168497085571, + "eval_mean_token_accuracy": 0.8500627639681794, + "eval_num_tokens": 5648968.0, + "eval_runtime": 85.8128, + "eval_samples_per_second": 16.023, + "eval_steps_per_second": 2.004, + "step": 2420 + }, + { + "entropy": 0.1534628233872354, + "epoch": 6.069738480697385, + "grad_norm": 0.710133969783783, + "learning_rate": 9.088662772316508e-05, + "loss": 0.09078952670097351, + "mean_token_accuracy": 0.9678447999060154, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.28208133101809857, + "eval_loss": 0.7636417150497437, + "eval_mean_token_accuracy": 0.8494061477655588, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9724, + "eval_samples_per_second": 15.994, + "eval_steps_per_second": 2.001, + "step": 2440 + }, + { + "entropy": 0.16151462448760867, + "epoch": 6.119551681195516, + "grad_norm": 0.5793812274932861, + "learning_rate": 8.896362400308028e-05, + "loss": 0.09545697569847107, + "mean_token_accuracy": 0.9671573750674725, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.2833245605403601, + "eval_loss": 0.7402405738830566, + "eval_mean_token_accuracy": 0.8503523728875226, + "eval_num_tokens": 5745090.0, + "eval_runtime": 85.5461, + "eval_samples_per_second": 16.073, + "eval_steps_per_second": 2.011, + "step": 2460 + }, + { + "entropy": 0.15203177919611335, + "epoch": 6.169364881693649, + "grad_norm": 0.4251123368740082, + "learning_rate": 8.704791146635483e-05, + "loss": 0.09420782327651978, + "mean_token_accuracy": 0.9677386932075024, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.28572545962971313, + "eval_loss": 0.735416829586029, + "eval_mean_token_accuracy": 0.8487084663884584, + "eval_num_tokens": 5790333.0, + "eval_runtime": 85.4801, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.012, + "step": 2480 + }, + { + "entropy": 0.15587336672469973, + "epoch": 6.219178082191781, + "grad_norm": 0.4357028007507324, + "learning_rate": 8.514006786576085e-05, + "loss": 0.09429320096969604, + "mean_token_accuracy": 0.9682952925562859, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.2859006894882335, + "eval_loss": 0.7347224950790405, + "eval_mean_token_accuracy": 0.8501905518215757, + "eval_num_tokens": 5837321.0, + "eval_runtime": 85.7578, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.006, + "step": 2500 + }, + { + "entropy": 0.15765639198943973, + "epoch": 6.268991282689913, + "grad_norm": 0.47331130504608154, + "learning_rate": 8.324066858090663e-05, + "loss": 0.09571113586425781, + "mean_token_accuracy": 0.9683481335639954, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.29231513846059176, + "eval_loss": 0.7392512559890747, + "eval_mean_token_accuracy": 0.8486633983462356, + "eval_num_tokens": 5884398.0, + "eval_runtime": 85.7846, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.005, + "step": 2520 + }, + { + "entropy": 0.16176860257983208, + "epoch": 6.318804483188045, + "grad_norm": 0.6142018437385559, + "learning_rate": 8.135028644470992e-05, + "loss": 0.09486144185066223, + "mean_token_accuracy": 0.9682316601276397, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.2851274753379267, + "eval_loss": 0.7520816922187805, + "eval_mean_token_accuracy": 0.8501113649717597, + "eval_num_tokens": 5929876.0, + "eval_runtime": 85.9425, + "eval_samples_per_second": 15.999, + "eval_steps_per_second": 2.001, + "step": 2540 + }, + { + "entropy": 0.15404034564271568, + "epoch": 6.3686176836861765, + "grad_norm": 0.6051287651062012, + "learning_rate": 7.946949157063964e-05, + "loss": 0.09280472993850708, + "mean_token_accuracy": 0.9684635892510414, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28802703563557114, + "eval_loss": 0.7439162135124207, + "eval_mean_token_accuracy": 0.8499851770872293, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.0703, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.998, + "step": 2560 + }, + { + "entropy": 0.15343588953837753, + "epoch": 6.418430884184309, + "grad_norm": 0.4823743402957916, + "learning_rate": 7.759885118077701e-05, + "loss": 0.09000591039657593, + "mean_token_accuracy": 0.9699928767979145, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2795634938533916, + "eval_loss": 0.7647850513458252, + "eval_mean_token_accuracy": 0.8503464397995971, + "eval_num_tokens": 6025380.0, + "eval_runtime": 85.8886, + "eval_samples_per_second": 16.009, + "eval_steps_per_second": 2.003, + "step": 2580 + }, + { + "entropy": 0.15740026142448188, + "epoch": 6.468244084682441, + "grad_norm": 0.5082696676254272, + "learning_rate": 7.57389294347494e-05, + "loss": 0.09191849827766418, + "mean_token_accuracy": 0.9692809768021107, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2913342311458532, + "eval_loss": 0.7518694996833801, + "eval_mean_token_accuracy": 0.8483168302580367, + "eval_num_tokens": 6073349.0, + "eval_runtime": 85.5761, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.01, + "step": 2600 + }, + { + "entropy": 0.15922069251537324, + "epoch": 6.518057285180573, + "grad_norm": 0.3995199501514435, + "learning_rate": 7.389028725958736e-05, + "loss": 0.09584367871284485, + "mean_token_accuracy": 0.9685114495456218, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.2863075934177221, + "eval_loss": 0.7539381384849548, + "eval_mean_token_accuracy": 0.8507507083027862, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.112, + "eval_samples_per_second": 15.968, + "eval_steps_per_second": 1.997, + "step": 2620 + }, + { + "entropy": 0.16197575423866512, + "epoch": 6.567870485678705, + "grad_norm": 0.534295380115509, + "learning_rate": 7.205348218055678e-05, + "loss": 0.0961170256137848, + "mean_token_accuracy": 0.9674530044198036, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.29021967315050057, + "eval_loss": 0.751198947429657, + "eval_mean_token_accuracy": 0.8509796344956686, + "eval_num_tokens": 6165523.0, + "eval_runtime": 85.7958, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.005, + "step": 2640 + }, + { + "entropy": 0.15261746793985367, + "epoch": 6.617683686176837, + "grad_norm": 0.5391237139701843, + "learning_rate": 7.022906815301673e-05, + "loss": 0.0926026999950409, + "mean_token_accuracy": 0.9695659473538398, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.29128045216202736, + "eval_loss": 0.7450292110443115, + "eval_mean_token_accuracy": 0.8498771443616512, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.3963, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 2660 + }, + { + "entropy": 0.16164180357009172, + "epoch": 6.667496886674969, + "grad_norm": 0.5767946243286133, + "learning_rate": 6.841759539535419e-05, + "loss": 0.09291981458663941, + "mean_token_accuracy": 0.9687136687338352, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2897637223088464, + "eval_loss": 0.7503410577774048, + "eval_mean_token_accuracy": 0.8503315164599308, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.0653, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.998, + "step": 2680 + }, + { + "entropy": 0.17062523355707526, + "epoch": 6.717310087173101, + "grad_norm": 0.4974168539047241, + "learning_rate": 6.661961022304563e-05, + "loss": 0.09713236689567566, + "mean_token_accuracy": 0.9661971725523472, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2765843396963075, + "eval_loss": 0.7604002356529236, + "eval_mean_token_accuracy": 0.8521115277395692, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.1676, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 2700 + }, + { + "entropy": 0.17544092936441302, + "epoch": 6.767123287671232, + "grad_norm": 0.5523537993431091, + "learning_rate": 6.483565488389582e-05, + "loss": 0.09709116220474243, + "mean_token_accuracy": 0.9650957375764847, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.27939334659035814, + "eval_loss": 0.7534670829772949, + "eval_mean_token_accuracy": 0.851230604010959, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.2913, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 2720 + }, + { + "entropy": 0.15991022661328316, + "epoch": 6.816936488169365, + "grad_norm": 0.478551983833313, + "learning_rate": 6.306626739450311e-05, + "loss": 0.09564646482467651, + "mean_token_accuracy": 0.9679084822535515, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.27878295491601146, + "eval_loss": 0.7519959211349487, + "eval_mean_token_accuracy": 0.8510654949864676, + "eval_num_tokens": 6397720.0, + "eval_runtime": 85.9109, + "eval_samples_per_second": 16.005, + "eval_steps_per_second": 2.002, + "step": 2740 + }, + { + "entropy": 0.16824879590421915, + "epoch": 6.866749688667497, + "grad_norm": 0.6681098937988281, + "learning_rate": 6.131198137800108e-05, + "loss": 0.0962279736995697, + "mean_token_accuracy": 0.966830012947321, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.2834690434121808, + "eval_loss": 0.751922070980072, + "eval_mean_token_accuracy": 0.8521237577809844, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.3618, + "eval_samples_per_second": 15.921, + "eval_steps_per_second": 1.992, + "step": 2760 + }, + { + "entropy": 0.1518704930320382, + "epoch": 6.916562889165629, + "grad_norm": 0.5201290249824524, + "learning_rate": 5.957332590312513e-05, + "loss": 0.09010660648345947, + "mean_token_accuracy": 0.9693463340401649, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.28485129617674404, + "eval_loss": 0.7452457547187805, + "eval_mean_token_accuracy": 0.8512036796919135, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.4524, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.99, + "step": 2780 + }, + { + "entropy": 0.15512610590085388, + "epoch": 6.966376089663761, + "grad_norm": 0.42802050709724426, + "learning_rate": 5.785082532465233e-05, + "loss": 0.09320432543754578, + "mean_token_accuracy": 0.9686134628951549, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.27554594526110693, + "eval_loss": 0.7644653916358948, + "eval_mean_token_accuracy": 0.8513738523389018, + "eval_num_tokens": 6540175.0, + "eval_runtime": 85.7609, + "eval_samples_per_second": 16.033, + "eval_steps_per_second": 2.006, + "step": 2800 + }, + { + "entropy": 0.17524497526196334, + "epoch": 7.01494396014944, + "grad_norm": 0.3330269157886505, + "learning_rate": 5.6144999125263545e-05, + "loss": 0.0895616888999939, + "mean_token_accuracy": 0.9682766932707566, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.2735865569218647, + "eval_loss": 0.768479585647583, + "eval_mean_token_accuracy": 0.8503459383581959, + "eval_num_tokens": 6583767.0, + "eval_runtime": 85.7162, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.007, + "step": 2820 + }, + { + "entropy": 0.1403565663844347, + "epoch": 7.064757160647572, + "grad_norm": 0.35613498091697693, + "learning_rate": 5.4456361758874235e-05, + "loss": 0.07551313638687134, + "mean_token_accuracy": 0.9739301167428493, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.25941789089593775, + "eval_loss": 0.8209511637687683, + "eval_mean_token_accuracy": 0.8505055855873019, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.0943, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 2840 + }, + { + "entropy": 0.13500106502324344, + "epoch": 7.114570361145703, + "grad_norm": 0.34418627619743347, + "learning_rate": 5.2785422495482234e-05, + "loss": 0.07293946146965027, + "mean_token_accuracy": 0.9747208289802074, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.26482899772912954, + "eval_loss": 0.798904538154602, + "eval_mean_token_accuracy": 0.8511530233677044, + "eval_num_tokens": 6672946.0, + "eval_runtime": 85.7915, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.005, + "step": 2860 + }, + { + "entropy": 0.13127502552233636, + "epoch": 7.164383561643835, + "grad_norm": 0.4638441503047943, + "learning_rate": 5.113268526757892e-05, + "loss": 0.07121461629867554, + "mean_token_accuracy": 0.9756786689162255, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2645381211714689, + "eval_loss": 0.809101939201355, + "eval_mean_token_accuracy": 0.8514727898115335, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.84, + "eval_samples_per_second": 16.018, + "eval_steps_per_second": 2.004, + "step": 2880 + }, + { + "entropy": 0.1331390908919275, + "epoch": 7.214196762141968, + "grad_norm": 0.40206775069236755, + "learning_rate": 4.949864851817007e-05, + "loss": 0.07188264131546021, + "mean_token_accuracy": 0.9755406074225903, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.26244733283339544, + "eval_loss": 0.8143188953399658, + "eval_mean_token_accuracy": 0.8514358189909957, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.8546, + "eval_samples_per_second": 16.015, + "eval_steps_per_second": 2.003, + "step": 2900 + }, + { + "entropy": 0.13647331558167936, + "epoch": 7.2640099626401, + "grad_norm": 0.26405787467956543, + "learning_rate": 4.788380505045224e-05, + "loss": 0.07412450313568116, + "mean_token_accuracy": 0.9744274213910102, + "num_tokens": 6809678.0, + "step": 2920 + }, + { + "epoch": 7.2640099626401, + "eval_entropy": 0.2626111418182074, + "eval_loss": 0.8111525177955627, + "eval_mean_token_accuracy": 0.8512121695418691, + "eval_num_tokens": 6809678.0, + "eval_runtime": 85.9626, + "eval_samples_per_second": 15.995, + "eval_steps_per_second": 2.001, + "step": 2920 + }, + { + "entropy": 0.12644002586603165, + "epoch": 7.313823163138232, + "grad_norm": 0.27514681220054626, + "learning_rate": 4.6288641879189884e-05, + "loss": 0.06807711124420165, + "mean_token_accuracy": 0.9760703906416893, + "num_tokens": 6860750.0, + "step": 2940 + }, + { + "epoch": 7.313823163138232, + "eval_entropy": 0.26096762734097106, + "eval_loss": 0.8184595108032227, + "eval_mean_token_accuracy": 0.8501476153384807, + "eval_num_tokens": 6860750.0, + "eval_runtime": 85.9521, + "eval_samples_per_second": 15.997, + "eval_steps_per_second": 2.001, + "step": 2940 + }, + { + "entropy": 0.13920630998909472, + "epoch": 7.363636363636363, + "grad_norm": 0.23584705591201782, + "learning_rate": 4.4713640083838604e-05, + "loss": 0.07301607131958007, + "mean_token_accuracy": 0.9745715200901032, + "num_tokens": 6907092.0, + "step": 2960 + }, + { + "epoch": 7.363636363636363, + "eval_entropy": 0.2612536767021168, + "eval_loss": 0.8116245269775391, + "eval_mean_token_accuracy": 0.8510967350976412, + "eval_num_tokens": 6907092.0, + "eval_runtime": 85.6373, + "eval_samples_per_second": 16.056, + "eval_steps_per_second": 2.008, + "step": 2960 + }, + { + "entropy": 0.1349492883309722, + "epoch": 7.4134495641344955, + "grad_norm": 0.24552719295024872, + "learning_rate": 4.315927466345791e-05, + "loss": 0.07397544980049134, + "mean_token_accuracy": 0.9745095103979111, + "num_tokens": 6952700.0, + "step": 2980 + }, + { + "epoch": 7.4134495641344955, + "eval_entropy": 0.25796533306670744, + "eval_loss": 0.8266491293907166, + "eval_mean_token_accuracy": 0.8511653857868772, + "eval_num_tokens": 6952700.0, + "eval_runtime": 85.7462, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.006, + "step": 2980 + }, + { + "entropy": 0.14479175000451505, + "epoch": 7.463262764632628, + "grad_norm": 0.2846072018146515, + "learning_rate": 4.162601439345814e-05, + "loss": 0.07544798254966736, + "mean_token_accuracy": 0.9727819666266442, + "num_tokens": 6996430.0, + "step": 3000 + }, + { + "epoch": 7.463262764632628, + "eval_entropy": 0.2584348309698493, + "eval_loss": 0.8253348469734192, + "eval_mean_token_accuracy": 0.8511569815319638, + "eval_num_tokens": 6996430.0, + "eval_runtime": 86.2984, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 3000 + }, + { + "entropy": 0.14114196319133043, + "epoch": 7.51307596513076, + "grad_norm": 0.407966285943985, + "learning_rate": 4.011432168422419e-05, + "loss": 0.0736398994922638, + "mean_token_accuracy": 0.9741654269397259, + "num_tokens": 7042038.0, + "step": 3020 + }, + { + "epoch": 7.51307596513076, + "eval_entropy": 0.25232676260693127, + "eval_loss": 0.8296052813529968, + "eval_mean_token_accuracy": 0.8523298349491385, + "eval_num_tokens": 7042038.0, + "eval_runtime": 85.8445, + "eval_samples_per_second": 16.017, + "eval_steps_per_second": 2.004, + "step": 3020 + }, + { + "entropy": 0.1353456223383546, + "epoch": 7.562889165628892, + "grad_norm": 0.2712634801864624, + "learning_rate": 3.8624652441658684e-05, + "loss": 0.07362412214279175, + "mean_token_accuracy": 0.9747945807874203, + "num_tokens": 7089390.0, + "step": 3040 + }, + { + "epoch": 7.562889165628892, + "eval_entropy": 0.2579477243991785, + "eval_loss": 0.8274564743041992, + "eval_mean_token_accuracy": 0.8517705212498821, + "eval_num_tokens": 7089390.0, + "eval_runtime": 85.8222, + "eval_samples_per_second": 16.022, + "eval_steps_per_second": 2.004, + "step": 3040 + }, + { + "entropy": 0.1296080862637609, + "epoch": 7.6127023661270234, + "grad_norm": 0.2371893972158432, + "learning_rate": 3.715745592968707e-05, + "loss": 0.06971035599708557, + "mean_token_accuracy": 0.9759043246507645, + "num_tokens": 7138002.0, + "step": 3060 + }, + { + "epoch": 7.6127023661270234, + "eval_entropy": 0.25391967083479083, + "eval_loss": 0.8197130560874939, + "eval_mean_token_accuracy": 0.8522267875283264, + "eval_num_tokens": 7138002.0, + "eval_runtime": 85.8796, + "eval_samples_per_second": 16.011, + "eval_steps_per_second": 2.003, + "step": 3060 + }, + { + "entropy": 0.1311203008517623, + "epoch": 7.662515566625156, + "grad_norm": 0.22499267756938934, + "learning_rate": 3.5713174634765967e-05, + "loss": 0.07176244258880615, + "mean_token_accuracy": 0.9754939571022987, + "num_tokens": 7185520.0, + "step": 3080 + }, + { + "epoch": 7.662515566625156, + "eval_entropy": 0.2526215241225653, + "eval_loss": 0.8265154361724854, + "eval_mean_token_accuracy": 0.8519952584837758, + "eval_num_tokens": 7185520.0, + "eval_runtime": 85.8746, + "eval_samples_per_second": 16.012, + "eval_steps_per_second": 2.003, + "step": 3080 + }, + { + "entropy": 0.13420484317466616, + "epoch": 7.712328767123288, + "grad_norm": 0.2398064285516739, + "learning_rate": 3.4292244132434866e-05, + "loss": 0.07559212446212768, + "mean_token_accuracy": 0.9743142127990723, + "num_tokens": 7232170.0, + "step": 3100 + }, + { + "epoch": 7.712328767123288, + "eval_entropy": 0.2484562756537005, + "eval_loss": 0.8312150239944458, + "eval_mean_token_accuracy": 0.8528405119513356, + "eval_num_tokens": 7232170.0, + "eval_runtime": 85.7896, + "eval_samples_per_second": 16.028, + "eval_steps_per_second": 2.005, + "step": 3100 + }, + { + "entropy": 0.11965563679113984, + "epoch": 7.76214196762142, + "grad_norm": 0.3408384919166565, + "learning_rate": 3.2895092955952746e-05, + "loss": 0.0661750853061676, + "mean_token_accuracy": 0.9776600524783134, + "num_tokens": 7282846.0, + "step": 3120 + }, + { + "epoch": 7.76214196762142, + "eval_entropy": 0.2522421533804993, + "eval_loss": 0.8327009677886963, + "eval_mean_token_accuracy": 0.8524222023958383, + "eval_num_tokens": 7282846.0, + "eval_runtime": 86.1769, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 1.996, + "step": 3120 + }, + { + "entropy": 0.13388084415346385, + "epoch": 7.811955168119551, + "grad_norm": 0.35418516397476196, + "learning_rate": 3.152214246705829e-05, + "loss": 0.07149899601936341, + "mean_token_accuracy": 0.9747635535895824, + "num_tokens": 7331518.0, + "step": 3140 + }, + { + "epoch": 7.811955168119551, + "eval_entropy": 0.25038352296795957, + "eval_loss": 0.836457371711731, + "eval_mean_token_accuracy": 0.8526130665180295, + "eval_num_tokens": 7331518.0, + "eval_runtime": 85.6099, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.009, + "step": 3140 + }, + { + "entropy": 0.13530643959529698, + "epoch": 7.861768368617684, + "grad_norm": 0.38060539960861206, + "learning_rate": 3.017380672889291e-05, + "loss": 0.07116585969924927, + "mean_token_accuracy": 0.973284512758255, + "num_tokens": 7379056.0, + "step": 3160 + }, + { + "epoch": 7.861768368617684, + "eval_entropy": 0.255092611319797, + "eval_loss": 0.8314701914787292, + "eval_mean_token_accuracy": 0.8520913099826768, + "eval_num_tokens": 7379056.0, + "eval_runtime": 85.877, + "eval_samples_per_second": 16.011, + "eval_steps_per_second": 2.003, + "step": 3160 + }, + { + "entropy": 0.13383390177041293, + "epoch": 7.911581569115816, + "grad_norm": 0.3827536106109619, + "learning_rate": 2.8850492381124808e-05, + "loss": 0.07305437326431274, + "mean_token_accuracy": 0.9750778004527092, + "num_tokens": 7424770.0, + "step": 3180 + }, + { + "epoch": 7.911581569115816, + "eval_entropy": 0.25416371157003004, + "eval_loss": 0.8206402063369751, + "eval_mean_token_accuracy": 0.852779901651449, + "eval_num_tokens": 7424770.0, + "eval_runtime": 86.1015, + "eval_samples_per_second": 15.97, + "eval_steps_per_second": 1.998, + "step": 3180 + }, + { + "entropy": 0.1395680439658463, + "epoch": 7.961394769613948, + "grad_norm": 0.3809775412082672, + "learning_rate": 2.7552598517312256e-05, + "loss": 0.07236042022705078, + "mean_token_accuracy": 0.9731538116931915, + "num_tokens": 7470804.0, + "step": 3200 + }, + { + "epoch": 7.961394769613948, + "eval_entropy": 0.25528111975899964, + "eval_loss": 0.8230037093162537, + "eval_mean_token_accuracy": 0.8526452603035195, + "eval_num_tokens": 7470804.0, + "eval_runtime": 85.7895, + "eval_samples_per_second": 16.028, + "eval_steps_per_second": 2.005, + "step": 3200 + }, + { + "entropy": 0.12193699864049752, + "epoch": 8.009962640099626, + "grad_norm": 0.11854425817728043, + "learning_rate": 2.6280516564542205e-05, + "loss": 0.06617764234542847, + "mean_token_accuracy": 0.977179691577569, + "num_tokens": 7518110.0, + "step": 3220 + }, + { + "epoch": 8.009962640099626, + "eval_entropy": 0.25100527677771656, + "eval_loss": 0.8393343687057495, + "eval_mean_token_accuracy": 0.8522553132023922, + "eval_num_tokens": 7518110.0, + "eval_runtime": 85.8837, + "eval_samples_per_second": 16.01, + "eval_steps_per_second": 2.003, + "step": 3220 + }, + { + "entropy": 0.12788885813206435, + "epoch": 8.059775840597759, + "grad_norm": 0.16094881296157837, + "learning_rate": 2.50346301653812e-05, + "loss": 0.06274186968803405, + "mean_token_accuracy": 0.9766994707286358, + "num_tokens": 7565539.0, + "step": 3240 + }, + { + "epoch": 8.059775840597759, + "eval_entropy": 0.24409458682287571, + "eval_loss": 0.874617338180542, + "eval_mean_token_accuracy": 0.8521041180505309, + "eval_num_tokens": 7565539.0, + "eval_runtime": 86.2656, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 3240 + }, + { + "entropy": 0.12464155335910618, + "epoch": 8.10958904109589, + "grad_norm": 0.16893954575061798, + "learning_rate": 2.381531506217437e-05, + "loss": 0.06093020439147949, + "mean_token_accuracy": 0.9776258453726768, + "num_tokens": 7612578.0, + "step": 3260 + }, + { + "epoch": 8.10958904109589, + "eval_entropy": 0.24396493017326953, + "eval_loss": 0.891161322593689, + "eval_mean_token_accuracy": 0.8515338024427724, + "eval_num_tokens": 7612578.0, + "eval_runtime": 85.9061, + "eval_samples_per_second": 16.006, + "eval_steps_per_second": 2.002, + "step": 3260 + }, + { + "entropy": 0.12345920228399336, + "epoch": 8.159402241594023, + "grad_norm": 0.14332273602485657, + "learning_rate": 2.262293898372616e-05, + "loss": 0.061289966106414795, + "mean_token_accuracy": 0.9762230902910233, + "num_tokens": 7660157.0, + "step": 3280 + }, + { + "epoch": 8.159402241594023, + "eval_entropy": 0.2481445314059424, + "eval_loss": 0.8922848105430603, + "eval_mean_token_accuracy": 0.8514944855556932, + "eval_num_tokens": 7660157.0, + "eval_runtime": 85.5201, + "eval_samples_per_second": 16.078, + "eval_steps_per_second": 2.011, + "step": 3280 + }, + { + "entropy": 0.12298110066913068, + "epoch": 8.209215442092155, + "grad_norm": 0.21848882734775543, + "learning_rate": 2.1457861534398633e-05, + "loss": 0.05986443758010864, + "mean_token_accuracy": 0.9786281704902648, + "num_tokens": 7709745.0, + "step": 3300 + }, + { + "epoch": 8.209215442092155, + "eval_entropy": 0.24329388124305149, + "eval_loss": 0.9021085500717163, + "eval_mean_token_accuracy": 0.8521762625422589, + "eval_num_tokens": 7709745.0, + "eval_runtime": 85.955, + "eval_samples_per_second": 15.997, + "eval_steps_per_second": 2.001, + "step": 3300 + }, + { + "entropy": 0.13265180448070168, + "epoch": 8.259028642590286, + "grad_norm": 0.18067947030067444, + "learning_rate": 2.0320434085659692e-05, + "loss": 0.06724961400032044, + "mean_token_accuracy": 0.975098168104887, + "num_tokens": 7753571.0, + "step": 3320 + }, + { + "epoch": 8.259028642590286, + "eval_entropy": 0.2433211464694766, + "eval_loss": 0.9094350337982178, + "eval_mean_token_accuracy": 0.8520150094531304, + "eval_num_tokens": 7753571.0, + "eval_runtime": 85.7989, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.005, + "step": 3320 + }, + { + "entropy": 0.11949320202693343, + "epoch": 8.308841843088418, + "grad_norm": 0.17020289599895477, + "learning_rate": 1.9210999670114196e-05, + "loss": 0.0634455680847168, + "mean_token_accuracy": 0.9771294385194779, + "num_tokens": 7799310.0, + "step": 3340 + }, + { + "epoch": 8.308841843088418, + "eval_entropy": 0.24345201219237128, + "eval_loss": 0.9021793603897095, + "eval_mean_token_accuracy": 0.8520745697409607, + "eval_num_tokens": 7799310.0, + "eval_runtime": 86.0883, + "eval_samples_per_second": 15.972, + "eval_steps_per_second": 1.998, + "step": 3340 + }, + { + "entropy": 0.12065747743472457, + "epoch": 8.35865504358655, + "grad_norm": 0.16789060831069946, + "learning_rate": 1.8129892878049886e-05, + "loss": 0.061494195461273195, + "mean_token_accuracy": 0.9779584899544715, + "num_tokens": 7846447.0, + "step": 3360 + }, + { + "epoch": 8.35865504358655, + "eval_entropy": 0.24093415042342142, + "eval_loss": 0.9006755352020264, + "eval_mean_token_accuracy": 0.852174230786257, + "eval_num_tokens": 7846447.0, + "eval_runtime": 85.9011, + "eval_samples_per_second": 16.007, + "eval_steps_per_second": 2.002, + "step": 3360 + }, + { + "entropy": 0.13125578537583352, + "epoch": 8.408468244084682, + "grad_norm": 0.1662452220916748, + "learning_rate": 1.70774397565298e-05, + "loss": 0.06685600876808166, + "mean_token_accuracy": 0.9744067586958408, + "num_tokens": 7890283.0, + "step": 3380 + }, + { + "epoch": 8.408468244084682, + "eval_entropy": 0.24062153688350388, + "eval_loss": 0.9078915119171143, + "eval_mean_token_accuracy": 0.8523201647886011, + "eval_num_tokens": 7890283.0, + "eval_runtime": 86.0201, + "eval_samples_per_second": 15.985, + "eval_steps_per_second": 2.0, + "step": 3380 + }, + { + "entropy": 0.11986117120832204, + "epoch": 8.458281444582815, + "grad_norm": 0.19571948051452637, + "learning_rate": 1.6053957711060606e-05, + "loss": 0.06411095261573792, + "mean_token_accuracy": 0.9770627245306969, + "num_tokens": 7936518.0, + "step": 3400 + }, + { + "epoch": 8.458281444582815, + "eval_entropy": 0.24352820347561394, + "eval_loss": 0.9058943390846252, + "eval_mean_token_accuracy": 0.8519382792156797, + "eval_num_tokens": 7936518.0, + "eval_runtime": 85.966, + "eval_samples_per_second": 15.995, + "eval_steps_per_second": 2.001, + "step": 3400 + }, + { + "entropy": 0.12857897616922856, + "epoch": 8.508094645080947, + "grad_norm": 0.2609264850616455, + "learning_rate": 1.5059755409867613e-05, + "loss": 0.06473397612571716, + "mean_token_accuracy": 0.9764650195837021, + "num_tokens": 7981966.0, + "step": 3420 + }, + { + "epoch": 8.508094645080947, + "eval_entropy": 0.24032609000108962, + "eval_loss": 0.9077776074409485, + "eval_mean_token_accuracy": 0.8517829197090726, + "eval_num_tokens": 7981966.0, + "eval_runtime": 86.6059, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 3420 + }, + { + "entropy": 0.12348870886489749, + "epoch": 8.557907845579079, + "grad_norm": 0.19537609815597534, + "learning_rate": 1.409513269080473e-05, + "loss": 0.06481348872184753, + "mean_token_accuracy": 0.9769559659063816, + "num_tokens": 8028367.0, + "step": 3440 + }, + { + "epoch": 8.557907845579079, + "eval_entropy": 0.2404322574824788, + "eval_loss": 0.9057720899581909, + "eval_mean_token_accuracy": 0.8521037981953732, + "eval_num_tokens": 8028367.0, + "eval_runtime": 86.166, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.996, + "step": 3440 + }, + { + "entropy": 0.12040232736617326, + "epoch": 8.607721046077211, + "grad_norm": 0.3310582935810089, + "learning_rate": 1.3160380470927183e-05, + "loss": 0.06468871235847473, + "mean_token_accuracy": 0.9768650442361831, + "num_tokens": 8074934.0, + "step": 3460 + }, + { + "epoch": 8.607721046077211, + "eval_entropy": 0.24118655876711356, + "eval_loss": 0.9028318524360657, + "eval_mean_token_accuracy": 0.8521025340224422, + "eval_num_tokens": 8074934.0, + "eval_runtime": 85.3668, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.015, + "step": 3460 + }, + { + "entropy": 0.12328103906475008, + "epoch": 8.657534246575342, + "grad_norm": 0.12836167216300964, + "learning_rate": 1.2255780658755122e-05, + "loss": 0.06229386329650879, + "mean_token_accuracy": 0.9763277888298034, + "num_tokens": 8122775.0, + "step": 3480 + }, + { + "epoch": 8.657534246575342, + "eval_entropy": 0.24194598145956217, + "eval_loss": 0.9009329080581665, + "eval_mean_token_accuracy": 0.8521693289973015, + "eval_num_tokens": 8122775.0, + "eval_runtime": 85.9415, + "eval_samples_per_second": 15.999, + "eval_steps_per_second": 2.001, + "step": 3480 + }, + { + "entropy": 0.11321646976284683, + "epoch": 8.707347447073474, + "grad_norm": 0.15656894445419312, + "learning_rate": 1.1381606069253786e-05, + "loss": 0.05908188819885254, + "mean_token_accuracy": 0.9779504477977753, + "num_tokens": 8174307.0, + "step": 3500 + }, + { + "epoch": 8.707347447073474, + "eval_entropy": 0.24121542517528977, + "eval_loss": 0.9016091823577881, + "eval_mean_token_accuracy": 0.8521790667328724, + "eval_num_tokens": 8174307.0, + "eval_runtime": 85.7465, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.006, + "step": 3500 + }, + { + "entropy": 0.12657046681270004, + "epoch": 8.757160647571606, + "grad_norm": 0.22597502171993256, + "learning_rate": 1.053812034155629e-05, + "loss": 0.06244581937789917, + "mean_token_accuracy": 0.976795207709074, + "num_tokens": 8222808.0, + "step": 3520 + }, + { + "epoch": 8.757160647571606, + "eval_entropy": 0.23877542708502258, + "eval_loss": 0.9069110155105591, + "eval_mean_token_accuracy": 0.8522880177858264, + "eval_num_tokens": 8222808.0, + "eval_runtime": 85.7792, + "eval_samples_per_second": 16.03, + "eval_steps_per_second": 2.005, + "step": 3520 + }, + { + "entropy": 0.11422101808711886, + "epoch": 8.806973848069738, + "grad_norm": 0.21139323711395264, + "learning_rate": 9.725577859453502e-06, + "loss": 0.05988085865974426, + "mean_token_accuracy": 0.9779510758817196, + "num_tokens": 8273335.0, + "step": 3540 + }, + { + "epoch": 8.806973848069738, + "eval_entropy": 0.2393161087881687, + "eval_loss": 0.9033801555633545, + "eval_mean_token_accuracy": 0.8522614209457885, + "eval_num_tokens": 8273335.0, + "eval_runtime": 85.5594, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 3540 + }, + { + "entropy": 0.13810604228638113, + "epoch": 8.85678704856787, + "grad_norm": 0.24571993947029114, + "learning_rate": 8.944223674675537e-06, + "loss": 0.07036117911338806, + "mean_token_accuracy": 0.9734892748296261, + "num_tokens": 8315235.0, + "step": 3560 + }, + { + "epoch": 8.85678704856787, + "eval_entropy": 0.23998506947658782, + "eval_loss": 0.9009848833084106, + "eval_mean_token_accuracy": 0.8521793619837872, + "eval_num_tokens": 8315235.0, + "eval_runtime": 86.0974, + "eval_samples_per_second": 15.97, + "eval_steps_per_second": 1.998, + "step": 3560 + }, + { + "entropy": 0.14193559321574867, + "epoch": 8.906600249066003, + "grad_norm": 0.17304112017154694, + "learning_rate": 8.194293432987386e-06, + "loss": 0.07077967524528503, + "mean_token_accuracy": 0.973305893689394, + "num_tokens": 8358099.0, + "step": 3580 + }, + { + "epoch": 8.906600249066003, + "eval_entropy": 0.23883876689644748, + "eval_loss": 0.9015622138977051, + "eval_mean_token_accuracy": 0.8524864378363587, + "eval_num_tokens": 8358099.0, + "eval_runtime": 86.0089, + "eval_samples_per_second": 15.987, + "eval_steps_per_second": 2.0, + "step": 3580 + }, + { + "entropy": 0.11878943420015275, + "epoch": 8.956413449564135, + "grad_norm": 0.19075658917427063, + "learning_rate": 7.476013303121426e-06, + "loss": 0.060806107521057126, + "mean_token_accuracy": 0.9776863709092141, + "num_tokens": 8407430.0, + "step": 3600 + }, + { + "epoch": 8.956413449564135, + "eval_entropy": 0.23726526309931, + "eval_loss": 0.9060276746749878, + "eval_mean_token_accuracy": 0.8524192058762838, + "eval_num_tokens": 8407430.0, + "eval_runtime": 85.7252, + "eval_samples_per_second": 16.04, + "eval_steps_per_second": 2.006, + "step": 3600 + }, + { + "entropy": 0.1255835090787747, + "epoch": 9.004981320049813, + "grad_norm": 0.11608047038316727, + "learning_rate": 6.78959990856799e-06, + "loss": 0.06319612860679627, + "mean_token_accuracy": 0.9766685519462976, + "num_tokens": 8453175.0, + "step": 3620 + }, + { + "epoch": 9.004981320049813, + "eval_entropy": 0.2373251837006835, + "eval_loss": 0.9045722484588623, + "eval_mean_token_accuracy": 0.8525558363559634, + "eval_num_tokens": 8453175.0, + "eval_runtime": 85.7435, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.006, + "step": 3620 + }, + { + "entropy": 0.12587778437882663, + "epoch": 9.054794520547945, + "grad_norm": 0.1564614623785019, + "learning_rate": 6.135260262244683e-06, + "loss": 0.0630365788936615, + "mean_token_accuracy": 0.9777486085891723, + "num_tokens": 8497151.0, + "step": 3640 + }, + { + "epoch": 9.054794520547945, + "eval_entropy": 0.23559923721260803, + "eval_loss": 0.9120694398880005, + "eval_mean_token_accuracy": 0.8525292966947999, + "eval_num_tokens": 8497151.0, + "eval_runtime": 85.8018, + "eval_samples_per_second": 16.025, + "eval_steps_per_second": 2.005, + "step": 3640 + }, + { + "entropy": 0.12535365503281354, + "epoch": 9.104607721046078, + "grad_norm": 0.1404249221086502, + "learning_rate": 5.513191704064086e-06, + "loss": 0.060502654314041136, + "mean_token_accuracy": 0.9770058333873749, + "num_tokens": 8542996.0, + "step": 3660 + }, + { + "epoch": 9.104607721046078, + "eval_entropy": 0.23525122691725575, + "eval_loss": 0.9182237982749939, + "eval_mean_token_accuracy": 0.8524098333924316, + "eval_num_tokens": 8542996.0, + "eval_runtime": 85.9872, + "eval_samples_per_second": 15.991, + "eval_steps_per_second": 2.0, + "step": 3660 + }, + { + "entropy": 0.11330419047735632, + "epoch": 9.15442092154421, + "grad_norm": 0.15513843297958374, + "learning_rate": 4.92358184141876e-06, + "loss": 0.05822383761405945, + "mean_token_accuracy": 0.9793384782969952, + "num_tokens": 8591625.0, + "step": 3680 + }, + { + "epoch": 9.15442092154421, + "eval_entropy": 0.2353947116711805, + "eval_loss": 0.9229223132133484, + "eval_mean_token_accuracy": 0.852500357253607, + "eval_num_tokens": 8591625.0, + "eval_runtime": 86.0805, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.998, + "step": 3680 + }, + { + "entropy": 0.11830627010203898, + "epoch": 9.204234122042342, + "grad_norm": 0.1730550080537796, + "learning_rate": 4.366608492601456e-06, + "loss": 0.05860854983329773, + "mean_token_accuracy": 0.9779663667082786, + "num_tokens": 8639845.0, + "step": 3700 + }, + { + "epoch": 9.204234122042342, + "eval_entropy": 0.23567205719476522, + "eval_loss": 0.9269373416900635, + "eval_mean_token_accuracy": 0.8523658004611038, + "eval_num_tokens": 8639845.0, + "eval_runtime": 85.9809, + "eval_samples_per_second": 15.992, + "eval_steps_per_second": 2.0, + "step": 3700 + }, + { + "entropy": 0.1180900705512613, + "epoch": 9.254047322540472, + "grad_norm": 0.20909737050533295, + "learning_rate": 3.842439633177387e-06, + "loss": 0.059438884258270264, + "mean_token_accuracy": 0.9786856278777123, + "num_tokens": 8687194.0, + "step": 3720 + }, + { + "epoch": 9.254047322540472, + "eval_entropy": 0.23602714493524196, + "eval_loss": 0.9293538928031921, + "eval_mean_token_accuracy": 0.8523273440294488, + "eval_num_tokens": 8687194.0, + "eval_runtime": 85.2118, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.019, + "step": 3720 + }, + { + "entropy": 0.13156692241318524, + "epoch": 9.303860523038605, + "grad_norm": 0.12535709142684937, + "learning_rate": 3.3512333453253305e-06, + "loss": 0.06337688565254211, + "mean_token_accuracy": 0.9756712593138218, + "num_tokens": 8731721.0, + "step": 3740 + }, + { + "epoch": 9.303860523038605, + "eval_entropy": 0.23534389351343, + "eval_loss": 0.932999312877655, + "eval_mean_token_accuracy": 0.8523333925147389, + "eval_num_tokens": 8731721.0, + "eval_runtime": 85.953, + "eval_samples_per_second": 15.997, + "eval_steps_per_second": 2.001, + "step": 3740 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.686834495186719e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3760/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3760/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3760/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3760/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3760/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3760/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3760/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3760/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3760/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3760/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3760/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3760/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3760/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3760/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..926e772f3bc449ec3b4d4ae7fb6e4fb8619e0a9f --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3760/trainer_state.json @@ -0,0 +1,3982 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 9.353673723536737, + "eval_steps": 20, + "global_step": 3760, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + }, + { + "entropy": 0.561330484598875, + "epoch": 1.891656288916563, + "grad_norm": 0.6722865700721741, + "learning_rate": 0.0002208867897174789, + "loss": 0.499837589263916, + "mean_token_accuracy": 0.8518734864890576, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.5865232653396074, + "eval_loss": 0.5437926650047302, + "eval_mean_token_accuracy": 0.8450997017843779, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4116, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.547389242425561, + "epoch": 1.9414694894146949, + "grad_norm": 0.7935577034950256, + "learning_rate": 0.00022027119820226907, + "loss": 0.4977591514587402, + "mean_token_accuracy": 0.8539491161704064, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.5290903090391048, + "eval_loss": 0.5409526824951172, + "eval_mean_token_accuracy": 0.8497545698354411, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.7262, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 780 + }, + { + "entropy": 0.5687909748405218, + "epoch": 1.9912826899128269, + "grad_norm": 0.6180546283721924, + "learning_rate": 0.00021962329729698345, + "loss": 0.5109643459320068, + "mean_token_accuracy": 0.8521598495543004, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.5503541858390321, + "eval_loss": 0.5361555218696594, + "eval_mean_token_accuracy": 0.8510884285666221, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.3339, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 800 + }, + { + "entropy": 0.4739728841261986, + "epoch": 2.0398505603985058, + "grad_norm": 0.8058829307556152, + "learning_rate": 0.0002189432823996982, + "loss": 0.4204097747802734, + "mean_token_accuracy": 0.8728981889211215, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.5077334992414297, + "eval_loss": 0.5531114339828491, + "eval_mean_token_accuracy": 0.8489257208136625, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.4801, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.989, + "step": 820 + }, + { + "entropy": 0.4594309840351343, + "epoch": 2.0896637608966375, + "grad_norm": 0.6906896829605103, + "learning_rate": 0.0002182313585936314, + "loss": 0.4071959495544434, + "mean_token_accuracy": 0.8732857562601566, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.49850136994622474, + "eval_loss": 0.5486204624176025, + "eval_mean_token_accuracy": 0.8507991450470548, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.3364, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.4881629109382629, + "epoch": 2.1394769613947697, + "grad_norm": 0.6343470215797424, + "learning_rate": 0.0002174877405852928, + "loss": 0.41669540405273436, + "mean_token_accuracy": 0.8711295068264008, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.49155513924914734, + "eval_loss": 0.555109441280365, + "eval_mean_token_accuracy": 0.8496399400539176, + "eval_num_tokens": 2008562.0, + "eval_runtime": 86.3295, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 860 + }, + { + "entropy": 0.4648668970912695, + "epoch": 2.1892901618929015, + "grad_norm": 0.8014165163040161, + "learning_rate": 0.00021671265263973133, + "loss": 0.4110250473022461, + "mean_token_accuracy": 0.8754166305065155, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.4909258722219356, + "eval_loss": 0.5539511442184448, + "eval_mean_token_accuracy": 0.8492401502160138, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.3468, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 880 + }, + { + "entropy": 0.4824485514312983, + "epoch": 2.2391033623910337, + "grad_norm": 0.6665191054344177, + "learning_rate": 0.00021590632851289967, + "loss": 0.4181404113769531, + "mean_token_accuracy": 0.8726993151009083, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.4986876940657926, + "eval_loss": 0.547695517539978, + "eval_mean_token_accuracy": 0.8501384708770486, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.3838, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 900 + }, + { + "entropy": 0.4751896943897009, + "epoch": 2.2889165628891655, + "grad_norm": 0.81158047914505, + "learning_rate": 0.00021506901138115678, + "loss": 0.40689678192138673, + "mean_token_accuracy": 0.8745221219956875, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.507153491121392, + "eval_loss": 0.5501641631126404, + "eval_mean_token_accuracy": 0.8495670116918032, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.0912, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 920 + }, + { + "entropy": 0.4873133715242147, + "epoch": 2.3387297633872977, + "grad_norm": 0.7218056321144104, + "learning_rate": 0.0002142009537679292, + "loss": 0.42701358795166017, + "mean_token_accuracy": 0.8695114746689796, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5202612736543943, + "eval_loss": 0.5491839051246643, + "eval_mean_token_accuracy": 0.8494071208460386, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.1142, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 940 + }, + { + "entropy": 0.4762951169162989, + "epoch": 2.3885429638854294, + "grad_norm": 0.7194424867630005, + "learning_rate": 0.0002133024174675534, + "loss": 0.42299847602844237, + "mean_token_accuracy": 0.8709790132939815, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4899340462546016, + "eval_loss": 0.5522511601448059, + "eval_mean_token_accuracy": 0.8492208258357159, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.463, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 960 + }, + { + "entropy": 0.49650347977876663, + "epoch": 2.4383561643835616, + "grad_norm": 0.8406022787094116, + "learning_rate": 0.0002123736734663221, + "loss": 0.4275330066680908, + "mean_token_accuracy": 0.8670595556497573, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.49691385654515996, + "eval_loss": 0.5491269826889038, + "eval_mean_token_accuracy": 0.850309816210769, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.17, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 980 + }, + { + "entropy": 0.48843890577554705, + "epoch": 2.488169364881694, + "grad_norm": 0.9082473516464233, + "learning_rate": 0.00021141500186075868, + "loss": 0.4309722423553467, + "mean_token_accuracy": 0.8686766296625137, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5543508351195691, + "eval_loss": 0.5478800535202026, + "eval_mean_token_accuracy": 0.8478029522784921, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.3835, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 1000 + }, + { + "entropy": 0.4777219031006098, + "epoch": 2.5379825653798256, + "grad_norm": 0.7448089122772217, + "learning_rate": 0.0002104266917731438, + "loss": 0.423325252532959, + "mean_token_accuracy": 0.8706337086856365, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.49857561550168106, + "eval_loss": 0.5511948466300964, + "eval_mean_token_accuracy": 0.8502220289651737, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.5399, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.988, + "step": 1020 + }, + { + "entropy": 0.4844174191355705, + "epoch": 2.587795765877958, + "grad_norm": 0.794029176235199, + "learning_rate": 0.00020940904126432, + "loss": 0.4176753044128418, + "mean_token_accuracy": 0.873535567522049, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.485467542222766, + "eval_loss": 0.5539286732673645, + "eval_mean_token_accuracy": 0.8495475081510322, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.135, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 1.997, + "step": 1040 + }, + { + "entropy": 0.49070929251611234, + "epoch": 2.6376089663760895, + "grad_norm": 0.7558256983757019, + "learning_rate": 0.0002083623572438007, + "loss": 0.42867293357849123, + "mean_token_accuracy": 0.8696666076779366, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.490822730889154, + "eval_loss": 0.5434785485267639, + "eval_mean_token_accuracy": 0.850568296950917, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.4933, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 1060 + }, + { + "entropy": 0.47806114703416824, + "epoch": 2.6874221668742218, + "grad_norm": 0.6608979105949402, + "learning_rate": 0.00020728695537721047, + "loss": 0.4289727687835693, + "mean_token_accuracy": 0.8693130135536193, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.5285773256490397, + "eval_loss": 0.5444230437278748, + "eval_mean_token_accuracy": 0.8498796481032704, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.7091, + "eval_samples_per_second": 15.858, + "eval_steps_per_second": 1.984, + "step": 1080 + }, + { + "entropy": 0.5046216730028391, + "epoch": 2.7372353673723535, + "grad_norm": 0.8428544998168945, + "learning_rate": 0.00020618315999108454, + "loss": 0.43131070137023925, + "mean_token_accuracy": 0.8701941035687923, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.49888394738352576, + "eval_loss": 0.5459766387939453, + "eval_mean_token_accuracy": 0.8511758872935938, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.2222, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.995, + "step": 1100 + }, + { + "entropy": 0.5212558470666409, + "epoch": 2.7870485678704857, + "grad_norm": 1.129318118095398, + "learning_rate": 0.00020505130397505635, + "loss": 0.44249300956726073, + "mean_token_accuracy": 0.8654101334512234, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5179622324053631, + "eval_loss": 0.5522801280021667, + "eval_mean_token_accuracy": 0.8497019947268242, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.1903, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.996, + "step": 1120 + }, + { + "entropy": 0.4988406613469124, + "epoch": 2.8368617683686175, + "grad_norm": 0.6460545063018799, + "learning_rate": 0.00020389172868146263, + "loss": 0.4386270523071289, + "mean_token_accuracy": 0.8690383620560169, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.5042278484203094, + "eval_loss": 0.5433034300804138, + "eval_mean_token_accuracy": 0.8497674451317898, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.3028, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.993, + "step": 1140 + }, + { + "entropy": 0.4926559619605541, + "epoch": 2.8866749688667497, + "grad_norm": 0.8199329972267151, + "learning_rate": 0.00020270478382239615, + "loss": 0.4313485145568848, + "mean_token_accuracy": 0.8674727231264114, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.503873193160046, + "eval_loss": 0.5388111472129822, + "eval_mean_token_accuracy": 0.8526195034731266, + "eval_num_tokens": 2710196.0, + "eval_runtime": 86.4054, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.991, + "step": 1160 + }, + { + "entropy": 0.5020013231784105, + "epoch": 2.936488169364882, + "grad_norm": 0.7344821095466614, + "learning_rate": 0.00020149082736423723, + "loss": 0.43590536117553713, + "mean_token_accuracy": 0.8671772189438343, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5368241809828337, + "eval_loss": 0.5355703830718994, + "eval_mean_token_accuracy": 0.8517617773871089, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.2945, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1180 + }, + { + "entropy": 0.5112275708466768, + "epoch": 2.9863013698630136, + "grad_norm": 0.6951606869697571, + "learning_rate": 0.00020025022541969622, + "loss": 0.43579301834106443, + "mean_token_accuracy": 0.8641206480562686, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.5066795706055885, + "eval_loss": 0.5415249466896057, + "eval_mean_token_accuracy": 0.8493563373421513, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.5005, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.988, + "step": 1200 + }, + { + "entropy": 0.42298635305502474, + "epoch": 3.0348692403486925, + "grad_norm": 0.8201794028282166, + "learning_rate": 0.00019898335213739863, + "loss": 0.35593905448913576, + "mean_token_accuracy": 0.889238600547497, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.4584170470750609, + "eval_loss": 0.569487452507019, + "eval_mean_token_accuracy": 0.8495814173027526, + "eval_num_tokens": 2848509.0, + "eval_runtime": 86.2281, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 1220 + }, + { + "entropy": 0.37450140453875064, + "epoch": 3.0846824408468243, + "grad_norm": 0.7308394908905029, + "learning_rate": 0.0001976905895890471, + "loss": 0.307823920249939, + "mean_token_accuracy": 0.9001288741827012, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.45185995916294497, + "eval_loss": 0.5672881603240967, + "eval_mean_token_accuracy": 0.8511318519364955, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.0819, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.998, + "step": 1240 + }, + { + "entropy": 0.3887945845723152, + "epoch": 3.1344956413449565, + "grad_norm": 0.7299330830574036, + "learning_rate": 0.0001963723276541939, + "loss": 0.32047903537750244, + "mean_token_accuracy": 0.8960984498262405, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.44865354549053105, + "eval_loss": 0.5666037201881409, + "eval_mean_token_accuracy": 0.8496572649063066, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 1260 + }, + { + "entropy": 0.39677664265036583, + "epoch": 3.1843088418430883, + "grad_norm": 0.9533219933509827, + "learning_rate": 0.00019502896390265838, + "loss": 0.3253983497619629, + "mean_token_accuracy": 0.8964207418262958, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.4641980809527774, + "eval_loss": 0.5814996957778931, + "eval_mean_token_accuracy": 0.8485886212005171, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.7784, + "eval_samples_per_second": 15.845, + "eval_steps_per_second": 1.982, + "step": 1280 + }, + { + "entropy": 0.39210722744464876, + "epoch": 3.2341220423412205, + "grad_norm": 0.7447651028633118, + "learning_rate": 0.00019366090347462545, + "loss": 0.3276803970336914, + "mean_token_accuracy": 0.8930055953562259, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43595615254585135, + "eval_loss": 0.5722188353538513, + "eval_mean_token_accuracy": 0.8501105755567551, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.5271, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 1300 + }, + { + "entropy": 0.3684127271175385, + "epoch": 3.2839352428393527, + "grad_norm": 0.6934201121330261, + "learning_rate": 0.00019226855895846078, + "loss": 0.3156379222869873, + "mean_token_accuracy": 0.8976306475698947, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.4628148723480313, + "eval_loss": 0.5631352066993713, + "eval_mean_token_accuracy": 0.8504934813394103, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.3436, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 1320 + }, + { + "entropy": 0.4073401909321547, + "epoch": 3.3337484433374844, + "grad_norm": 0.9386897683143616, + "learning_rate": 0.00019085235026627994, + "loss": 0.34265310764312745, + "mean_token_accuracy": 0.8902062118053437, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.46455050623694133, + "eval_loss": 0.5586736798286438, + "eval_mean_token_accuracy": 0.8506874702004499, + "eval_num_tokens": 3132874.0, + "eval_runtime": 86.1286, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.997, + "step": 1340 + }, + { + "entropy": 0.4046429242938757, + "epoch": 3.383561643835616, + "grad_norm": 0.9633992314338684, + "learning_rate": 0.00018941270450730836, + "loss": 0.33816893100738527, + "mean_token_accuracy": 0.8927541889250279, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.46846531660750856, + "eval_loss": 0.561501681804657, + "eval_mean_token_accuracy": 0.8496256377114806, + "eval_num_tokens": 3178055.0, + "eval_runtime": 86.685, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1360 + }, + { + "entropy": 0.39872407019138334, + "epoch": 3.4333748443337484, + "grad_norm": 0.7786458730697632, + "learning_rate": 0.00018795005585907113, + "loss": 0.33342490196228025, + "mean_token_accuracy": 0.8944805048406124, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.42709505973860273, + "eval_loss": 0.5751848220825195, + "eval_mean_token_accuracy": 0.8507290447867194, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.6892, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 1380 + }, + { + "entropy": 0.3923338124528527, + "epoch": 3.4831880448318806, + "grad_norm": 0.9305956363677979, + "learning_rate": 0.0001864648454364511, + "loss": 0.33188116550445557, + "mean_token_accuracy": 0.8943330392241478, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.4386174779298694, + "eval_loss": 0.5680831074714661, + "eval_mean_token_accuracy": 0.8513129727784977, + "eval_num_tokens": 3274096.0, + "eval_runtime": 86.2671, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 1400 + }, + { + "entropy": 0.3856233984231949, + "epoch": 3.5330012453300124, + "grad_norm": 1.0362752676010132, + "learning_rate": 0.0001849575211586545, + "loss": 0.33098697662353516, + "mean_token_accuracy": 0.8961390435695649, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4574795474493226, + "eval_loss": 0.5630439519882202, + "eval_mean_token_accuracy": 0.8520988873964133, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.6035, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 1420 + }, + { + "entropy": 0.39812871962785723, + "epoch": 3.5828144458281446, + "grad_norm": 0.7807195782661438, + "learning_rate": 0.0001834285376141247, + "loss": 0.3333771228790283, + "mean_token_accuracy": 0.8930827379226685, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.4556825893909432, + "eval_loss": 0.5689062476158142, + "eval_mean_token_accuracy": 0.8507103507601937, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.1606, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.996, + "step": 1440 + }, + { + "entropy": 0.4147744856774807, + "epoch": 3.6326276463262763, + "grad_norm": 0.6429352164268494, + "learning_rate": 0.00018187835592344443, + "loss": 0.3482560873031616, + "mean_token_accuracy": 0.8910200245678425, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.46600024540757023, + "eval_loss": 0.5609709024429321, + "eval_mean_token_accuracy": 0.8491220876227977, + "eval_num_tokens": 3415600.0, + "eval_runtime": 86.8039, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1460 + }, + { + "entropy": 0.40425071083009245, + "epoch": 3.6824408468244085, + "grad_norm": 0.8613698482513428, + "learning_rate": 0.0001803074436002682, + "loss": 0.342916464805603, + "mean_token_accuracy": 0.8916418336331844, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.43855057899342026, + "eval_loss": 0.5720968246459961, + "eval_mean_token_accuracy": 0.8500823641932288, + "eval_num_tokens": 3460471.0, + "eval_runtime": 86.6746, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1480 + }, + { + "entropy": 0.39465143866837027, + "epoch": 3.7322540473225407, + "grad_norm": 0.6285189986228943, + "learning_rate": 0.0001787162744103265, + "loss": 0.3424591779708862, + "mean_token_accuracy": 0.8906558901071548, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4509461877304454, + "eval_loss": 0.5590082406997681, + "eval_mean_token_accuracy": 0.8511747371318729, + "eval_num_tokens": 3507647.0, + "eval_runtime": 86.8126, + "eval_samples_per_second": 15.839, + "eval_steps_per_second": 1.981, + "step": 1500 + }, + { + "entropy": 0.4021005939692259, + "epoch": 3.7820672478206725, + "grad_norm": 0.8821248412132263, + "learning_rate": 0.00017710532822854468, + "loss": 0.3462103843688965, + "mean_token_accuracy": 0.889109355956316, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.4502199075596277, + "eval_loss": 0.566046416759491, + "eval_mean_token_accuracy": 0.8501714208098345, + "eval_num_tokens": 3548934.0, + "eval_runtime": 86.8336, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.981, + "step": 1520 + }, + { + "entropy": 0.4017397932708263, + "epoch": 3.8318804483188043, + "grad_norm": 0.8400952816009521, + "learning_rate": 0.0001754750908943189, + "loss": 0.34890995025634763, + "mean_token_accuracy": 0.8892098367214203, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.4614003023435903, + "eval_loss": 0.5617933869361877, + "eval_mean_token_accuracy": 0.8515863616106122, + "eval_num_tokens": 3597186.0, + "eval_runtime": 86.4609, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 1540 + }, + { + "entropy": 0.4112051840871572, + "epoch": 3.8816936488169365, + "grad_norm": 0.769478440284729, + "learning_rate": 0.0001738260540649939, + "loss": 0.34711437225341796, + "mean_token_accuracy": 0.8911717928946018, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4540443811998811, + "eval_loss": 0.5576469898223877, + "eval_mean_token_accuracy": 0.8512079674144124, + "eval_num_tokens": 3646646.0, + "eval_runtime": 86.5103, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 1560 + }, + { + "entropy": 0.41105241514742374, + "epoch": 3.9315068493150687, + "grad_norm": 0.8468427062034607, + "learning_rate": 0.00017215871506758568, + "loss": 0.3433023452758789, + "mean_token_accuracy": 0.8898739732801915, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.4707539707075718, + "eval_loss": 0.5641466379165649, + "eval_mean_token_accuracy": 0.8495440957851188, + "eval_num_tokens": 3689560.0, + "eval_runtime": 86.609, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.986, + "step": 1580 + }, + { + "entropy": 0.41016379147768023, + "epoch": 3.9813200498132004, + "grad_norm": 0.7482675313949585, + "learning_rate": 0.0001704735767487946, + "loss": 0.34550890922546384, + "mean_token_accuracy": 0.8893028847873211, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.46391099864660307, + "eval_loss": 0.5593640804290771, + "eval_mean_token_accuracy": 0.8510130581467651, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.3975, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 1600 + }, + { + "entropy": 0.33167599791135544, + "epoch": 4.029887920298879, + "grad_norm": 0.9435692429542542, + "learning_rate": 0.00016877114732335337, + "loss": 0.2716026544570923, + "mean_token_accuracy": 0.9133149828666296, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.38499350005457567, + "eval_loss": 0.6298249363899231, + "eval_mean_token_accuracy": 0.8488117071778275, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.2933, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1620 + }, + { + "entropy": 0.3000166634097695, + "epoch": 4.0797011207970115, + "grad_norm": 0.8080845475196838, + "learning_rate": 0.0001670519402207569, + "loss": 0.22617182731628419, + "mean_token_accuracy": 0.9253474645316601, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.370110988703578, + "eval_loss": 0.6338461637496948, + "eval_mean_token_accuracy": 0.8485634801692741, + "eval_num_tokens": 3828830.0, + "eval_runtime": 85.9508, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.001, + "step": 1640 + }, + { + "entropy": 0.2986910421401262, + "epoch": 4.129514321295143, + "grad_norm": 0.7310900092124939, + "learning_rate": 0.0001653164739304185, + "loss": 0.22367463111877442, + "mean_token_accuracy": 0.9252275295555592, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.3944379702037157, + "eval_loss": 0.6109381914138794, + "eval_mean_token_accuracy": 0.849291454220927, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.6728, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1660 + }, + { + "entropy": 0.3095553796738386, + "epoch": 4.179327521793275, + "grad_norm": 0.7059140801429749, + "learning_rate": 0.0001635652718453007, + "loss": 0.23651680946350098, + "mean_token_accuracy": 0.9208931416273117, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.3910588648949945, + "eval_loss": 0.6104469299316406, + "eval_mean_token_accuracy": 0.8486883893262508, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7612, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.982, + "step": 1680 + }, + { + "entropy": 0.3001101028174162, + "epoch": 4.229140722291407, + "grad_norm": 0.6787802577018738, + "learning_rate": 0.00016179886210406728, + "loss": 0.23130471706390382, + "mean_token_accuracy": 0.9233332790434361, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3794369170832079, + "eval_loss": 0.6182110905647278, + "eval_mean_token_accuracy": 0.8495433777570724, + "eval_num_tokens": 3967474.0, + "eval_runtime": 85.94, + "eval_samples_per_second": 16.0, + "eval_steps_per_second": 2.001, + "step": 1700 + }, + { + "entropy": 0.3031421799212694, + "epoch": 4.2789539227895395, + "grad_norm": 0.9732038378715515, + "learning_rate": 0.0001600177774318036, + "loss": 0.2359529733657837, + "mean_token_accuracy": 0.9217648565769195, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3923123094231583, + "eval_loss": 0.6057384610176086, + "eval_mean_token_accuracy": 0.8508818288182103, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7647, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.29365369994193313, + "epoch": 4.328767123287671, + "grad_norm": 0.7681498527526855, + "learning_rate": 0.0001582225549793541, + "loss": 0.2269371747970581, + "mean_token_accuracy": 0.9245341829955578, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.4011661055129628, + "eval_loss": 0.6144486665725708, + "eval_mean_token_accuracy": 0.8480324357054955, + "eval_num_tokens": 4062594.0, + "eval_runtime": 87.1306, + "eval_samples_per_second": 15.781, + "eval_steps_per_second": 1.974, + "step": 1740 + }, + { + "entropy": 0.29396994728595016, + "epoch": 4.378580323785803, + "grad_norm": 1.0001007318496704, + "learning_rate": 0.0001564137361613248, + "loss": 0.22777395248413085, + "mean_token_accuracy": 0.9262309700250626, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38518730195802314, + "eval_loss": 0.6202630400657654, + "eval_mean_token_accuracy": 0.8493869807137999, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6616, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.3096018506214023, + "epoch": 4.428393524283935, + "grad_norm": 1.0448365211486816, + "learning_rate": 0.00015459186649280024, + "loss": 0.23696351051330566, + "mean_token_accuracy": 0.9217322513461113, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.3946371126140273, + "eval_loss": 0.6079026460647583, + "eval_mean_token_accuracy": 0.8492515852978063, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6582, + "eval_samples_per_second": 15.867, + "eval_steps_per_second": 1.985, + "step": 1780 + }, + { + "entropy": 0.32619857545942066, + "epoch": 4.478206724782067, + "grad_norm": 0.7210651636123657, + "learning_rate": 0.00015275749542482337, + "loss": 0.24651215076446534, + "mean_token_accuracy": 0.9177676141262054, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.3947690814560236, + "eval_loss": 0.6065912246704102, + "eval_mean_token_accuracy": 0.8502957744653835, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.5959, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.986, + "step": 1800 + }, + { + "entropy": 0.3193941755220294, + "epoch": 4.5280199252802, + "grad_norm": 0.8281906843185425, + "learning_rate": 0.0001509111761786888, + "loss": 0.23936262130737304, + "mean_token_accuracy": 0.9201708927750587, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38704028864239537, + "eval_loss": 0.6006569266319275, + "eval_mean_token_accuracy": 0.8502406720505205, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.8059, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1820 + }, + { + "entropy": 0.3164879363030195, + "epoch": 4.577833125778331, + "grad_norm": 0.7892968654632568, + "learning_rate": 0.00014905346557909867, + "loss": 0.24541733264923096, + "mean_token_accuracy": 0.9175932116806507, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.38861122120951497, + "eval_loss": 0.6115967631340027, + "eval_mean_token_accuracy": 0.849471275196519, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.2946, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1840 + }, + { + "entropy": 0.3051785985007882, + "epoch": 4.627646326276463, + "grad_norm": 0.8109654188156128, + "learning_rate": 0.0001471849238862319, + "loss": 0.23433220386505127, + "mean_token_accuracy": 0.9206570319831371, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.37162452295076015, + "eval_loss": 0.6184061765670776, + "eval_mean_token_accuracy": 0.8501173268223918, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.6865, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1860 + }, + { + "entropy": 0.3168198253959417, + "epoch": 4.677459526774595, + "grad_norm": 0.9512342214584351, + "learning_rate": 0.0001453061146267775, + "loss": 0.23832404613494873, + "mean_token_accuracy": 0.9197044663131237, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3845940856912801, + "eval_loss": 0.606762707233429, + "eval_mean_token_accuracy": 0.8504838194957999, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.5175, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 1880 + }, + { + "entropy": 0.30791807882487776, + "epoch": 4.7272727272727275, + "grad_norm": 0.8123113512992859, + "learning_rate": 0.00014341760442398248, + "loss": 0.2395785331726074, + "mean_token_accuracy": 0.918928150832653, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.39762327222283494, + "eval_loss": 0.5994202494621277, + "eval_mean_token_accuracy": 0.8509274201337681, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.2873, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.993, + "step": 1900 + }, + { + "entropy": 0.3021434534341097, + "epoch": 4.777085927770859, + "grad_norm": 0.731787383556366, + "learning_rate": 0.000141519962826766, + "loss": 0.23494718074798585, + "mean_token_accuracy": 0.9201403826475143, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.3827026732439219, + "eval_loss": 0.5995895862579346, + "eval_mean_token_accuracy": 0.851468373523202, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.3006, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 1920 + }, + { + "entropy": 0.31626159623265265, + "epoch": 4.826899128268991, + "grad_norm": 0.8848487138748169, + "learning_rate": 0.00013961376213795132, + "loss": 0.2439030647277832, + "mean_token_accuracy": 0.9196575872600079, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.388698436839636, + "eval_loss": 0.6000174283981323, + "eval_mean_token_accuracy": 0.8518068187458571, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.8979, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.979, + "step": 1940 + }, + { + "entropy": 0.30520407035946845, + "epoch": 4.876712328767123, + "grad_norm": 0.8532460927963257, + "learning_rate": 0.00013769957724166695, + "loss": 0.23458616733551024, + "mean_token_accuracy": 0.9221912942826748, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.38777847102908203, + "eval_loss": 0.6004981398582458, + "eval_mean_token_accuracy": 0.8516481768253238, + "eval_num_tokens": 4578167.0, + "eval_runtime": 87.0777, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.975, + "step": 1960 + }, + { + "entropy": 0.3226448342204094, + "epoch": 4.926525529265255, + "grad_norm": 0.6945561766624451, + "learning_rate": 0.0001357779854299694, + "loss": 0.24048397541046143, + "mean_token_accuracy": 0.9195300146937371, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.38581624263247777, + "eval_loss": 0.6029234528541565, + "eval_mean_token_accuracy": 0.8514213260523108, + "eval_num_tokens": 4622316.0, + "eval_runtime": 85.8729, + "eval_samples_per_second": 16.012, + "eval_steps_per_second": 2.003, + "step": 1980 + }, + { + "entropy": 0.3051655298098922, + "epoch": 4.976338729763388, + "grad_norm": 0.7976452708244324, + "learning_rate": 0.00013384956622874001, + "loss": 0.23584742546081544, + "mean_token_accuracy": 0.9216851457953453, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.37913159246361533, + "eval_loss": 0.6057604551315308, + "eval_mean_token_accuracy": 0.8525801203971686, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.1145, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 2000 + }, + { + "entropy": 0.27438195240803254, + "epoch": 5.024906600249066, + "grad_norm": 0.6729586124420166, + "learning_rate": 0.0001319149012229075, + "loss": 0.19775952100753785, + "mean_token_accuracy": 0.9339428559327737, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.3448961910813354, + "eval_loss": 0.6750120520591736, + "eval_mean_token_accuracy": 0.8487970232963562, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.1169, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 2020 + }, + { + "entropy": 0.21423916313797237, + "epoch": 5.074719800747198, + "grad_norm": 0.6934391856193542, + "learning_rate": 0.00012997457388105022, + "loss": 0.1439570426940918, + "mean_token_accuracy": 0.9528236843645572, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.3570949243771475, + "eval_loss": 0.6465504169464111, + "eval_mean_token_accuracy": 0.8490785547467166, + "eval_num_tokens": 4763269.0, + "eval_runtime": 85.9574, + "eval_samples_per_second": 15.996, + "eval_steps_per_second": 2.001, + "step": 2040 + }, + { + "entropy": 0.20838565267622472, + "epoch": 5.12453300124533, + "grad_norm": 0.7286986112594604, + "learning_rate": 0.00012802916937942972, + "loss": 0.14467307329177856, + "mean_token_accuracy": 0.950994835793972, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.3452463157821533, + "eval_loss": 0.6705958843231201, + "eval_mean_token_accuracy": 0.8490352796953778, + "eval_num_tokens": 4809047.0, + "eval_runtime": 86.228, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 2060 + }, + { + "entropy": 0.20453082229942082, + "epoch": 5.174346201743462, + "grad_norm": 0.7515555620193481, + "learning_rate": 0.00012607927442550974, + "loss": 0.13732000589370727, + "mean_token_accuracy": 0.9537357829511166, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.32431264914745506, + "eval_loss": 0.6743043065071106, + "eval_mean_token_accuracy": 0.8504878629085629, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.5948, + "eval_samples_per_second": 15.879, + "eval_steps_per_second": 1.986, + "step": 2080 + }, + { + "entropy": 0.21812320686876774, + "epoch": 5.224159402241594, + "grad_norm": 0.9093465209007263, + "learning_rate": 0.0001241254770810132, + "loss": 0.14311420917510986, + "mean_token_accuracy": 0.9514068141579628, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.33086285835435225, + "eval_loss": 0.6676449179649353, + "eval_mean_token_accuracy": 0.8505287662495015, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 2100 + }, + { + "entropy": 0.2180163251236081, + "epoch": 5.273972602739726, + "grad_norm": 0.6703007221221924, + "learning_rate": 0.00012216836658457075, + "loss": 0.14803968667984008, + "mean_token_accuracy": 0.9521303348243236, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.33162341708707255, + "eval_loss": 0.6658875942230225, + "eval_mean_token_accuracy": 0.8500757605530495, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.6296, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 2120 + }, + { + "entropy": 0.22511130161583423, + "epoch": 5.323785803237858, + "grad_norm": 0.8078880906105042, + "learning_rate": 0.00012020853317401455, + "loss": 0.15228408575057983, + "mean_token_accuracy": 0.947144789993763, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3354601170434508, + "eval_loss": 0.6677829623222351, + "eval_mean_token_accuracy": 0.8482600024273229, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.4689, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.989, + "step": 2140 + }, + { + "entropy": 0.2244176059961319, + "epoch": 5.37359900373599, + "grad_norm": 0.9636075496673584, + "learning_rate": 0.00011824656790837037, + "loss": 0.15260883569717407, + "mean_token_accuracy": 0.9471467643976211, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.3381616926297199, + "eval_loss": 0.6694412231445312, + "eval_mean_token_accuracy": 0.8482369603805764, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.4147, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 2160 + }, + { + "entropy": 0.22982364390045404, + "epoch": 5.423412204234122, + "grad_norm": 0.775401771068573, + "learning_rate": 0.00011628306248960262, + "loss": 0.15140302181243898, + "mean_token_accuracy": 0.9492553934454918, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.3305150235808173, + "eval_loss": 0.6717822551727295, + "eval_mean_token_accuracy": 0.8489849723355715, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.4728, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.989, + "step": 2180 + }, + { + "entropy": 0.21448935717344284, + "epoch": 5.473225404732254, + "grad_norm": 0.6575281023979187, + "learning_rate": 0.00011431860908416465, + "loss": 0.1452319622039795, + "mean_token_accuracy": 0.9505287684500218, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3488145174328671, + "eval_loss": 0.6612305641174316, + "eval_mean_token_accuracy": 0.8492907808963642, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6927, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 2200 + }, + { + "entropy": 0.23091202937066554, + "epoch": 5.523038605230386, + "grad_norm": 0.8909686207771301, + "learning_rate": 0.00011235380014440985, + "loss": 0.15150139331817628, + "mean_token_accuracy": 0.9497875183820724, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.3268539015810157, + "eval_loss": 0.6667542457580566, + "eval_mean_token_accuracy": 0.8499062903398691, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.4644, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 2220 + }, + { + "entropy": 0.2227974807843566, + "epoch": 5.572851805728518, + "grad_norm": 0.6180275082588196, + "learning_rate": 0.0001103892282299158, + "loss": 0.1491069197654724, + "mean_token_accuracy": 0.9488144010305405, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3346347655494546, + "eval_loss": 0.6665948629379272, + "eval_mean_token_accuracy": 0.8499961893918903, + "eval_num_tokens": 5226864.0, + "eval_runtime": 87.0548, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.976, + "step": 2240 + }, + { + "entropy": 0.21368421968072654, + "epoch": 5.62266500622665, + "grad_norm": 0.6004369258880615, + "learning_rate": 0.00010842548582877651, + "loss": 0.14485255479812623, + "mean_token_accuracy": 0.9502056457102299, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.32753298804163933, + "eval_loss": 0.6680151224136353, + "eval_mean_token_accuracy": 0.8515451086121936, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.8524, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.98, + "step": 2260 + }, + { + "entropy": 0.2103635374456644, + "epoch": 5.672478206724782, + "grad_norm": 0.699174702167511, + "learning_rate": 0.00010646316517891613, + "loss": 0.14297772645950318, + "mean_token_accuracy": 0.9512537539005279, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.32966585959806, + "eval_loss": 0.675578773021698, + "eval_mean_token_accuracy": 0.8509623023659684, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.4518, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.99, + "step": 2280 + }, + { + "entropy": 0.22516900151968003, + "epoch": 5.722291407222914, + "grad_norm": 0.6637354493141174, + "learning_rate": 0.00010450285808947797, + "loss": 0.15202572345733642, + "mean_token_accuracy": 0.9482452072203159, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3369456917740578, + "eval_loss": 0.6697061061859131, + "eval_mean_token_accuracy": 0.848603522361711, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.6371, + "eval_samples_per_second": 15.871, + "eval_steps_per_second": 1.985, + "step": 2300 + }, + { + "entropy": 0.21841065725311637, + "epoch": 5.772104607721046, + "grad_norm": 0.7940268516540527, + "learning_rate": 0.00010254515576234297, + "loss": 0.14710167646408082, + "mean_token_accuracy": 0.9493498183786869, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3237486180177955, + "eval_loss": 0.6779657602310181, + "eval_mean_token_accuracy": 0.8500715313955794, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.1826, + "eval_samples_per_second": 15.954, + "eval_steps_per_second": 1.996, + "step": 2320 + }, + { + "entropy": 0.22146204356104135, + "epoch": 5.821917808219178, + "grad_norm": 0.9234833121299744, + "learning_rate": 0.00010059064861383132, + "loss": 0.14720046520233154, + "mean_token_accuracy": 0.9493872679769992, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.32365207564692167, + "eval_loss": 0.6704005002975464, + "eval_mean_token_accuracy": 0.8507985760306203, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.5494, + "eval_samples_per_second": 15.887, + "eval_steps_per_second": 1.987, + "step": 2340 + }, + { + "entropy": 0.20934011954814197, + "epoch": 5.87173100871731, + "grad_norm": 0.5547503232955933, + "learning_rate": 9.863992609664084e-05, + "loss": 0.1464867353439331, + "mean_token_accuracy": 0.9503875687718392, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.3330401429083458, + "eval_loss": 0.6659091114997864, + "eval_mean_token_accuracy": 0.8504848906467127, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.5855, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 2360 + }, + { + "entropy": 0.21678635366261007, + "epoch": 5.921544209215442, + "grad_norm": 0.570612907409668, + "learning_rate": 9.669357652207635e-05, + "loss": 0.14821385145187377, + "mean_token_accuracy": 0.9503940217196941, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3322022325077722, + "eval_loss": 0.6722489595413208, + "eval_mean_token_accuracy": 0.8489979422369669, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.2986, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 2380 + }, + { + "entropy": 0.20932920072227718, + "epoch": 5.971357409713574, + "grad_norm": 0.7879557609558105, + "learning_rate": 9.475218688262262e-05, + "loss": 0.14675841331481934, + "mean_token_accuracy": 0.9507176131010056, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.3199348642902319, + "eval_loss": 0.6698136329650879, + "eval_mean_token_accuracy": 0.8514142130003419, + "eval_num_tokens": 5605400.0, + "eval_runtime": 85.8995, + "eval_samples_per_second": 16.007, + "eval_steps_per_second": 2.002, + "step": 2400 + }, + { + "entropy": 0.21032143919131693, + "epoch": 6.019925280199253, + "grad_norm": 0.5823076367378235, + "learning_rate": 9.281634267491569e-05, + "loss": 0.13322267532348633, + "mean_token_accuracy": 0.9550939072401096, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.30206270117399303, + "eval_loss": 0.7093168497085571, + "eval_mean_token_accuracy": 0.8500627639681794, + "eval_num_tokens": 5648968.0, + "eval_runtime": 85.8128, + "eval_samples_per_second": 16.023, + "eval_steps_per_second": 2.004, + "step": 2420 + }, + { + "entropy": 0.1534628233872354, + "epoch": 6.069738480697385, + "grad_norm": 0.710133969783783, + "learning_rate": 9.088662772316508e-05, + "loss": 0.09078952670097351, + "mean_token_accuracy": 0.9678447999060154, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.28208133101809857, + "eval_loss": 0.7636417150497437, + "eval_mean_token_accuracy": 0.8494061477655588, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9724, + "eval_samples_per_second": 15.994, + "eval_steps_per_second": 2.001, + "step": 2440 + }, + { + "entropy": 0.16151462448760867, + "epoch": 6.119551681195516, + "grad_norm": 0.5793812274932861, + "learning_rate": 8.896362400308028e-05, + "loss": 0.09545697569847107, + "mean_token_accuracy": 0.9671573750674725, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.2833245605403601, + "eval_loss": 0.7402405738830566, + "eval_mean_token_accuracy": 0.8503523728875226, + "eval_num_tokens": 5745090.0, + "eval_runtime": 85.5461, + "eval_samples_per_second": 16.073, + "eval_steps_per_second": 2.011, + "step": 2460 + }, + { + "entropy": 0.15203177919611335, + "epoch": 6.169364881693649, + "grad_norm": 0.4251123368740082, + "learning_rate": 8.704791146635483e-05, + "loss": 0.09420782327651978, + "mean_token_accuracy": 0.9677386932075024, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.28572545962971313, + "eval_loss": 0.735416829586029, + "eval_mean_token_accuracy": 0.8487084663884584, + "eval_num_tokens": 5790333.0, + "eval_runtime": 85.4801, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.012, + "step": 2480 + }, + { + "entropy": 0.15587336672469973, + "epoch": 6.219178082191781, + "grad_norm": 0.4357028007507324, + "learning_rate": 8.514006786576085e-05, + "loss": 0.09429320096969604, + "mean_token_accuracy": 0.9682952925562859, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.2859006894882335, + "eval_loss": 0.7347224950790405, + "eval_mean_token_accuracy": 0.8501905518215757, + "eval_num_tokens": 5837321.0, + "eval_runtime": 85.7578, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.006, + "step": 2500 + }, + { + "entropy": 0.15765639198943973, + "epoch": 6.268991282689913, + "grad_norm": 0.47331130504608154, + "learning_rate": 8.324066858090663e-05, + "loss": 0.09571113586425781, + "mean_token_accuracy": 0.9683481335639954, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.29231513846059176, + "eval_loss": 0.7392512559890747, + "eval_mean_token_accuracy": 0.8486633983462356, + "eval_num_tokens": 5884398.0, + "eval_runtime": 85.7846, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.005, + "step": 2520 + }, + { + "entropy": 0.16176860257983208, + "epoch": 6.318804483188045, + "grad_norm": 0.6142018437385559, + "learning_rate": 8.135028644470992e-05, + "loss": 0.09486144185066223, + "mean_token_accuracy": 0.9682316601276397, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.2851274753379267, + "eval_loss": 0.7520816922187805, + "eval_mean_token_accuracy": 0.8501113649717597, + "eval_num_tokens": 5929876.0, + "eval_runtime": 85.9425, + "eval_samples_per_second": 15.999, + "eval_steps_per_second": 2.001, + "step": 2540 + }, + { + "entropy": 0.15404034564271568, + "epoch": 6.3686176836861765, + "grad_norm": 0.6051287651062012, + "learning_rate": 7.946949157063964e-05, + "loss": 0.09280472993850708, + "mean_token_accuracy": 0.9684635892510414, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28802703563557114, + "eval_loss": 0.7439162135124207, + "eval_mean_token_accuracy": 0.8499851770872293, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.0703, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.998, + "step": 2560 + }, + { + "entropy": 0.15343588953837753, + "epoch": 6.418430884184309, + "grad_norm": 0.4823743402957916, + "learning_rate": 7.759885118077701e-05, + "loss": 0.09000591039657593, + "mean_token_accuracy": 0.9699928767979145, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2795634938533916, + "eval_loss": 0.7647850513458252, + "eval_mean_token_accuracy": 0.8503464397995971, + "eval_num_tokens": 6025380.0, + "eval_runtime": 85.8886, + "eval_samples_per_second": 16.009, + "eval_steps_per_second": 2.003, + "step": 2580 + }, + { + "entropy": 0.15740026142448188, + "epoch": 6.468244084682441, + "grad_norm": 0.5082696676254272, + "learning_rate": 7.57389294347494e-05, + "loss": 0.09191849827766418, + "mean_token_accuracy": 0.9692809768021107, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2913342311458532, + "eval_loss": 0.7518694996833801, + "eval_mean_token_accuracy": 0.8483168302580367, + "eval_num_tokens": 6073349.0, + "eval_runtime": 85.5761, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.01, + "step": 2600 + }, + { + "entropy": 0.15922069251537324, + "epoch": 6.518057285180573, + "grad_norm": 0.3995199501514435, + "learning_rate": 7.389028725958736e-05, + "loss": 0.09584367871284485, + "mean_token_accuracy": 0.9685114495456218, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.2863075934177221, + "eval_loss": 0.7539381384849548, + "eval_mean_token_accuracy": 0.8507507083027862, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.112, + "eval_samples_per_second": 15.968, + "eval_steps_per_second": 1.997, + "step": 2620 + }, + { + "entropy": 0.16197575423866512, + "epoch": 6.567870485678705, + "grad_norm": 0.534295380115509, + "learning_rate": 7.205348218055678e-05, + "loss": 0.0961170256137848, + "mean_token_accuracy": 0.9674530044198036, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.29021967315050057, + "eval_loss": 0.751198947429657, + "eval_mean_token_accuracy": 0.8509796344956686, + "eval_num_tokens": 6165523.0, + "eval_runtime": 85.7958, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.005, + "step": 2640 + }, + { + "entropy": 0.15261746793985367, + "epoch": 6.617683686176837, + "grad_norm": 0.5391237139701843, + "learning_rate": 7.022906815301673e-05, + "loss": 0.0926026999950409, + "mean_token_accuracy": 0.9695659473538398, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.29128045216202736, + "eval_loss": 0.7450292110443115, + "eval_mean_token_accuracy": 0.8498771443616512, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.3963, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 2660 + }, + { + "entropy": 0.16164180357009172, + "epoch": 6.667496886674969, + "grad_norm": 0.5767946243286133, + "learning_rate": 6.841759539535419e-05, + "loss": 0.09291981458663941, + "mean_token_accuracy": 0.9687136687338352, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2897637223088464, + "eval_loss": 0.7503410577774048, + "eval_mean_token_accuracy": 0.8503315164599308, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.0653, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.998, + "step": 2680 + }, + { + "entropy": 0.17062523355707526, + "epoch": 6.717310087173101, + "grad_norm": 0.4974168539047241, + "learning_rate": 6.661961022304563e-05, + "loss": 0.09713236689567566, + "mean_token_accuracy": 0.9661971725523472, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2765843396963075, + "eval_loss": 0.7604002356529236, + "eval_mean_token_accuracy": 0.8521115277395692, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.1676, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 2700 + }, + { + "entropy": 0.17544092936441302, + "epoch": 6.767123287671232, + "grad_norm": 0.5523537993431091, + "learning_rate": 6.483565488389582e-05, + "loss": 0.09709116220474243, + "mean_token_accuracy": 0.9650957375764847, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.27939334659035814, + "eval_loss": 0.7534670829772949, + "eval_mean_token_accuracy": 0.851230604010959, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.2913, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 2720 + }, + { + "entropy": 0.15991022661328316, + "epoch": 6.816936488169365, + "grad_norm": 0.478551983833313, + "learning_rate": 6.306626739450311e-05, + "loss": 0.09564646482467651, + "mean_token_accuracy": 0.9679084822535515, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.27878295491601146, + "eval_loss": 0.7519959211349487, + "eval_mean_token_accuracy": 0.8510654949864676, + "eval_num_tokens": 6397720.0, + "eval_runtime": 85.9109, + "eval_samples_per_second": 16.005, + "eval_steps_per_second": 2.002, + "step": 2740 + }, + { + "entropy": 0.16824879590421915, + "epoch": 6.866749688667497, + "grad_norm": 0.6681098937988281, + "learning_rate": 6.131198137800108e-05, + "loss": 0.0962279736995697, + "mean_token_accuracy": 0.966830012947321, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.2834690434121808, + "eval_loss": 0.751922070980072, + "eval_mean_token_accuracy": 0.8521237577809844, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.3618, + "eval_samples_per_second": 15.921, + "eval_steps_per_second": 1.992, + "step": 2760 + }, + { + "entropy": 0.1518704930320382, + "epoch": 6.916562889165629, + "grad_norm": 0.5201290249824524, + "learning_rate": 5.957332590312513e-05, + "loss": 0.09010660648345947, + "mean_token_accuracy": 0.9693463340401649, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.28485129617674404, + "eval_loss": 0.7452457547187805, + "eval_mean_token_accuracy": 0.8512036796919135, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.4524, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.99, + "step": 2780 + }, + { + "entropy": 0.15512610590085388, + "epoch": 6.966376089663761, + "grad_norm": 0.42802050709724426, + "learning_rate": 5.785082532465233e-05, + "loss": 0.09320432543754578, + "mean_token_accuracy": 0.9686134628951549, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.27554594526110693, + "eval_loss": 0.7644653916358948, + "eval_mean_token_accuracy": 0.8513738523389018, + "eval_num_tokens": 6540175.0, + "eval_runtime": 85.7609, + "eval_samples_per_second": 16.033, + "eval_steps_per_second": 2.006, + "step": 2800 + }, + { + "entropy": 0.17524497526196334, + "epoch": 7.01494396014944, + "grad_norm": 0.3330269157886505, + "learning_rate": 5.6144999125263545e-05, + "loss": 0.0895616888999939, + "mean_token_accuracy": 0.9682766932707566, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.2735865569218647, + "eval_loss": 0.768479585647583, + "eval_mean_token_accuracy": 0.8503459383581959, + "eval_num_tokens": 6583767.0, + "eval_runtime": 85.7162, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.007, + "step": 2820 + }, + { + "entropy": 0.1403565663844347, + "epoch": 7.064757160647572, + "grad_norm": 0.35613498091697693, + "learning_rate": 5.4456361758874235e-05, + "loss": 0.07551313638687134, + "mean_token_accuracy": 0.9739301167428493, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.25941789089593775, + "eval_loss": 0.8209511637687683, + "eval_mean_token_accuracy": 0.8505055855873019, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.0943, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 2840 + }, + { + "entropy": 0.13500106502324344, + "epoch": 7.114570361145703, + "grad_norm": 0.34418627619743347, + "learning_rate": 5.2785422495482234e-05, + "loss": 0.07293946146965027, + "mean_token_accuracy": 0.9747208289802074, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.26482899772912954, + "eval_loss": 0.798904538154602, + "eval_mean_token_accuracy": 0.8511530233677044, + "eval_num_tokens": 6672946.0, + "eval_runtime": 85.7915, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.005, + "step": 2860 + }, + { + "entropy": 0.13127502552233636, + "epoch": 7.164383561643835, + "grad_norm": 0.4638441503047943, + "learning_rate": 5.113268526757892e-05, + "loss": 0.07121461629867554, + "mean_token_accuracy": 0.9756786689162255, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2645381211714689, + "eval_loss": 0.809101939201355, + "eval_mean_token_accuracy": 0.8514727898115335, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.84, + "eval_samples_per_second": 16.018, + "eval_steps_per_second": 2.004, + "step": 2880 + }, + { + "entropy": 0.1331390908919275, + "epoch": 7.214196762141968, + "grad_norm": 0.40206775069236755, + "learning_rate": 4.949864851817007e-05, + "loss": 0.07188264131546021, + "mean_token_accuracy": 0.9755406074225903, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.26244733283339544, + "eval_loss": 0.8143188953399658, + "eval_mean_token_accuracy": 0.8514358189909957, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.8546, + "eval_samples_per_second": 16.015, + "eval_steps_per_second": 2.003, + "step": 2900 + }, + { + "entropy": 0.13647331558167936, + "epoch": 7.2640099626401, + "grad_norm": 0.26405787467956543, + "learning_rate": 4.788380505045224e-05, + "loss": 0.07412450313568116, + "mean_token_accuracy": 0.9744274213910102, + "num_tokens": 6809678.0, + "step": 2920 + }, + { + "epoch": 7.2640099626401, + "eval_entropy": 0.2626111418182074, + "eval_loss": 0.8111525177955627, + "eval_mean_token_accuracy": 0.8512121695418691, + "eval_num_tokens": 6809678.0, + "eval_runtime": 85.9626, + "eval_samples_per_second": 15.995, + "eval_steps_per_second": 2.001, + "step": 2920 + }, + { + "entropy": 0.12644002586603165, + "epoch": 7.313823163138232, + "grad_norm": 0.27514681220054626, + "learning_rate": 4.6288641879189884e-05, + "loss": 0.06807711124420165, + "mean_token_accuracy": 0.9760703906416893, + "num_tokens": 6860750.0, + "step": 2940 + }, + { + "epoch": 7.313823163138232, + "eval_entropy": 0.26096762734097106, + "eval_loss": 0.8184595108032227, + "eval_mean_token_accuracy": 0.8501476153384807, + "eval_num_tokens": 6860750.0, + "eval_runtime": 85.9521, + "eval_samples_per_second": 15.997, + "eval_steps_per_second": 2.001, + "step": 2940 + }, + { + "entropy": 0.13920630998909472, + "epoch": 7.363636363636363, + "grad_norm": 0.23584705591201782, + "learning_rate": 4.4713640083838604e-05, + "loss": 0.07301607131958007, + "mean_token_accuracy": 0.9745715200901032, + "num_tokens": 6907092.0, + "step": 2960 + }, + { + "epoch": 7.363636363636363, + "eval_entropy": 0.2612536767021168, + "eval_loss": 0.8116245269775391, + "eval_mean_token_accuracy": 0.8510967350976412, + "eval_num_tokens": 6907092.0, + "eval_runtime": 85.6373, + "eval_samples_per_second": 16.056, + "eval_steps_per_second": 2.008, + "step": 2960 + }, + { + "entropy": 0.1349492883309722, + "epoch": 7.4134495641344955, + "grad_norm": 0.24552719295024872, + "learning_rate": 4.315927466345791e-05, + "loss": 0.07397544980049134, + "mean_token_accuracy": 0.9745095103979111, + "num_tokens": 6952700.0, + "step": 2980 + }, + { + "epoch": 7.4134495641344955, + "eval_entropy": 0.25796533306670744, + "eval_loss": 0.8266491293907166, + "eval_mean_token_accuracy": 0.8511653857868772, + "eval_num_tokens": 6952700.0, + "eval_runtime": 85.7462, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.006, + "step": 2980 + }, + { + "entropy": 0.14479175000451505, + "epoch": 7.463262764632628, + "grad_norm": 0.2846072018146515, + "learning_rate": 4.162601439345814e-05, + "loss": 0.07544798254966736, + "mean_token_accuracy": 0.9727819666266442, + "num_tokens": 6996430.0, + "step": 3000 + }, + { + "epoch": 7.463262764632628, + "eval_entropy": 0.2584348309698493, + "eval_loss": 0.8253348469734192, + "eval_mean_token_accuracy": 0.8511569815319638, + "eval_num_tokens": 6996430.0, + "eval_runtime": 86.2984, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 3000 + }, + { + "entropy": 0.14114196319133043, + "epoch": 7.51307596513076, + "grad_norm": 0.407966285943985, + "learning_rate": 4.011432168422419e-05, + "loss": 0.0736398994922638, + "mean_token_accuracy": 0.9741654269397259, + "num_tokens": 7042038.0, + "step": 3020 + }, + { + "epoch": 7.51307596513076, + "eval_entropy": 0.25232676260693127, + "eval_loss": 0.8296052813529968, + "eval_mean_token_accuracy": 0.8523298349491385, + "eval_num_tokens": 7042038.0, + "eval_runtime": 85.8445, + "eval_samples_per_second": 16.017, + "eval_steps_per_second": 2.004, + "step": 3020 + }, + { + "entropy": 0.1353456223383546, + "epoch": 7.562889165628892, + "grad_norm": 0.2712634801864624, + "learning_rate": 3.8624652441658684e-05, + "loss": 0.07362412214279175, + "mean_token_accuracy": 0.9747945807874203, + "num_tokens": 7089390.0, + "step": 3040 + }, + { + "epoch": 7.562889165628892, + "eval_entropy": 0.2579477243991785, + "eval_loss": 0.8274564743041992, + "eval_mean_token_accuracy": 0.8517705212498821, + "eval_num_tokens": 7089390.0, + "eval_runtime": 85.8222, + "eval_samples_per_second": 16.022, + "eval_steps_per_second": 2.004, + "step": 3040 + }, + { + "entropy": 0.1296080862637609, + "epoch": 7.6127023661270234, + "grad_norm": 0.2371893972158432, + "learning_rate": 3.715745592968707e-05, + "loss": 0.06971035599708557, + "mean_token_accuracy": 0.9759043246507645, + "num_tokens": 7138002.0, + "step": 3060 + }, + { + "epoch": 7.6127023661270234, + "eval_entropy": 0.25391967083479083, + "eval_loss": 0.8197130560874939, + "eval_mean_token_accuracy": 0.8522267875283264, + "eval_num_tokens": 7138002.0, + "eval_runtime": 85.8796, + "eval_samples_per_second": 16.011, + "eval_steps_per_second": 2.003, + "step": 3060 + }, + { + "entropy": 0.1311203008517623, + "epoch": 7.662515566625156, + "grad_norm": 0.22499267756938934, + "learning_rate": 3.5713174634765967e-05, + "loss": 0.07176244258880615, + "mean_token_accuracy": 0.9754939571022987, + "num_tokens": 7185520.0, + "step": 3080 + }, + { + "epoch": 7.662515566625156, + "eval_entropy": 0.2526215241225653, + "eval_loss": 0.8265154361724854, + "eval_mean_token_accuracy": 0.8519952584837758, + "eval_num_tokens": 7185520.0, + "eval_runtime": 85.8746, + "eval_samples_per_second": 16.012, + "eval_steps_per_second": 2.003, + "step": 3080 + }, + { + "entropy": 0.13420484317466616, + "epoch": 7.712328767123288, + "grad_norm": 0.2398064285516739, + "learning_rate": 3.4292244132434866e-05, + "loss": 0.07559212446212768, + "mean_token_accuracy": 0.9743142127990723, + "num_tokens": 7232170.0, + "step": 3100 + }, + { + "epoch": 7.712328767123288, + "eval_entropy": 0.2484562756537005, + "eval_loss": 0.8312150239944458, + "eval_mean_token_accuracy": 0.8528405119513356, + "eval_num_tokens": 7232170.0, + "eval_runtime": 85.7896, + "eval_samples_per_second": 16.028, + "eval_steps_per_second": 2.005, + "step": 3100 + }, + { + "entropy": 0.11965563679113984, + "epoch": 7.76214196762142, + "grad_norm": 0.3408384919166565, + "learning_rate": 3.2895092955952746e-05, + "loss": 0.0661750853061676, + "mean_token_accuracy": 0.9776600524783134, + "num_tokens": 7282846.0, + "step": 3120 + }, + { + "epoch": 7.76214196762142, + "eval_entropy": 0.2522421533804993, + "eval_loss": 0.8327009677886963, + "eval_mean_token_accuracy": 0.8524222023958383, + "eval_num_tokens": 7282846.0, + "eval_runtime": 86.1769, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 1.996, + "step": 3120 + }, + { + "entropy": 0.13388084415346385, + "epoch": 7.811955168119551, + "grad_norm": 0.35418516397476196, + "learning_rate": 3.152214246705829e-05, + "loss": 0.07149899601936341, + "mean_token_accuracy": 0.9747635535895824, + "num_tokens": 7331518.0, + "step": 3140 + }, + { + "epoch": 7.811955168119551, + "eval_entropy": 0.25038352296795957, + "eval_loss": 0.836457371711731, + "eval_mean_token_accuracy": 0.8526130665180295, + "eval_num_tokens": 7331518.0, + "eval_runtime": 85.6099, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.009, + "step": 3140 + }, + { + "entropy": 0.13530643959529698, + "epoch": 7.861768368617684, + "grad_norm": 0.38060539960861206, + "learning_rate": 3.017380672889291e-05, + "loss": 0.07116585969924927, + "mean_token_accuracy": 0.973284512758255, + "num_tokens": 7379056.0, + "step": 3160 + }, + { + "epoch": 7.861768368617684, + "eval_entropy": 0.255092611319797, + "eval_loss": 0.8314701914787292, + "eval_mean_token_accuracy": 0.8520913099826768, + "eval_num_tokens": 7379056.0, + "eval_runtime": 85.877, + "eval_samples_per_second": 16.011, + "eval_steps_per_second": 2.003, + "step": 3160 + }, + { + "entropy": 0.13383390177041293, + "epoch": 7.911581569115816, + "grad_norm": 0.3827536106109619, + "learning_rate": 2.8850492381124808e-05, + "loss": 0.07305437326431274, + "mean_token_accuracy": 0.9750778004527092, + "num_tokens": 7424770.0, + "step": 3180 + }, + { + "epoch": 7.911581569115816, + "eval_entropy": 0.25416371157003004, + "eval_loss": 0.8206402063369751, + "eval_mean_token_accuracy": 0.852779901651449, + "eval_num_tokens": 7424770.0, + "eval_runtime": 86.1015, + "eval_samples_per_second": 15.97, + "eval_steps_per_second": 1.998, + "step": 3180 + }, + { + "entropy": 0.1395680439658463, + "epoch": 7.961394769613948, + "grad_norm": 0.3809775412082672, + "learning_rate": 2.7552598517312256e-05, + "loss": 0.07236042022705078, + "mean_token_accuracy": 0.9731538116931915, + "num_tokens": 7470804.0, + "step": 3200 + }, + { + "epoch": 7.961394769613948, + "eval_entropy": 0.25528111975899964, + "eval_loss": 0.8230037093162537, + "eval_mean_token_accuracy": 0.8526452603035195, + "eval_num_tokens": 7470804.0, + "eval_runtime": 85.7895, + "eval_samples_per_second": 16.028, + "eval_steps_per_second": 2.005, + "step": 3200 + }, + { + "entropy": 0.12193699864049752, + "epoch": 8.009962640099626, + "grad_norm": 0.11854425817728043, + "learning_rate": 2.6280516564542205e-05, + "loss": 0.06617764234542847, + "mean_token_accuracy": 0.977179691577569, + "num_tokens": 7518110.0, + "step": 3220 + }, + { + "epoch": 8.009962640099626, + "eval_entropy": 0.25100527677771656, + "eval_loss": 0.8393343687057495, + "eval_mean_token_accuracy": 0.8522553132023922, + "eval_num_tokens": 7518110.0, + "eval_runtime": 85.8837, + "eval_samples_per_second": 16.01, + "eval_steps_per_second": 2.003, + "step": 3220 + }, + { + "entropy": 0.12788885813206435, + "epoch": 8.059775840597759, + "grad_norm": 0.16094881296157837, + "learning_rate": 2.50346301653812e-05, + "loss": 0.06274186968803405, + "mean_token_accuracy": 0.9766994707286358, + "num_tokens": 7565539.0, + "step": 3240 + }, + { + "epoch": 8.059775840597759, + "eval_entropy": 0.24409458682287571, + "eval_loss": 0.874617338180542, + "eval_mean_token_accuracy": 0.8521041180505309, + "eval_num_tokens": 7565539.0, + "eval_runtime": 86.2656, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 3240 + }, + { + "entropy": 0.12464155335910618, + "epoch": 8.10958904109589, + "grad_norm": 0.16893954575061798, + "learning_rate": 2.381531506217437e-05, + "loss": 0.06093020439147949, + "mean_token_accuracy": 0.9776258453726768, + "num_tokens": 7612578.0, + "step": 3260 + }, + { + "epoch": 8.10958904109589, + "eval_entropy": 0.24396493017326953, + "eval_loss": 0.891161322593689, + "eval_mean_token_accuracy": 0.8515338024427724, + "eval_num_tokens": 7612578.0, + "eval_runtime": 85.9061, + "eval_samples_per_second": 16.006, + "eval_steps_per_second": 2.002, + "step": 3260 + }, + { + "entropy": 0.12345920228399336, + "epoch": 8.159402241594023, + "grad_norm": 0.14332273602485657, + "learning_rate": 2.262293898372616e-05, + "loss": 0.061289966106414795, + "mean_token_accuracy": 0.9762230902910233, + "num_tokens": 7660157.0, + "step": 3280 + }, + { + "epoch": 8.159402241594023, + "eval_entropy": 0.2481445314059424, + "eval_loss": 0.8922848105430603, + "eval_mean_token_accuracy": 0.8514944855556932, + "eval_num_tokens": 7660157.0, + "eval_runtime": 85.5201, + "eval_samples_per_second": 16.078, + "eval_steps_per_second": 2.011, + "step": 3280 + }, + { + "entropy": 0.12298110066913068, + "epoch": 8.209215442092155, + "grad_norm": 0.21848882734775543, + "learning_rate": 2.1457861534398633e-05, + "loss": 0.05986443758010864, + "mean_token_accuracy": 0.9786281704902648, + "num_tokens": 7709745.0, + "step": 3300 + }, + { + "epoch": 8.209215442092155, + "eval_entropy": 0.24329388124305149, + "eval_loss": 0.9021085500717163, + "eval_mean_token_accuracy": 0.8521762625422589, + "eval_num_tokens": 7709745.0, + "eval_runtime": 85.955, + "eval_samples_per_second": 15.997, + "eval_steps_per_second": 2.001, + "step": 3300 + }, + { + "entropy": 0.13265180448070168, + "epoch": 8.259028642590286, + "grad_norm": 0.18067947030067444, + "learning_rate": 2.0320434085659692e-05, + "loss": 0.06724961400032044, + "mean_token_accuracy": 0.975098168104887, + "num_tokens": 7753571.0, + "step": 3320 + }, + { + "epoch": 8.259028642590286, + "eval_entropy": 0.2433211464694766, + "eval_loss": 0.9094350337982178, + "eval_mean_token_accuracy": 0.8520150094531304, + "eval_num_tokens": 7753571.0, + "eval_runtime": 85.7989, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.005, + "step": 3320 + }, + { + "entropy": 0.11949320202693343, + "epoch": 8.308841843088418, + "grad_norm": 0.17020289599895477, + "learning_rate": 1.9210999670114196e-05, + "loss": 0.0634455680847168, + "mean_token_accuracy": 0.9771294385194779, + "num_tokens": 7799310.0, + "step": 3340 + }, + { + "epoch": 8.308841843088418, + "eval_entropy": 0.24345201219237128, + "eval_loss": 0.9021793603897095, + "eval_mean_token_accuracy": 0.8520745697409607, + "eval_num_tokens": 7799310.0, + "eval_runtime": 86.0883, + "eval_samples_per_second": 15.972, + "eval_steps_per_second": 1.998, + "step": 3340 + }, + { + "entropy": 0.12065747743472457, + "epoch": 8.35865504358655, + "grad_norm": 0.16789060831069946, + "learning_rate": 1.8129892878049886e-05, + "loss": 0.061494195461273195, + "mean_token_accuracy": 0.9779584899544715, + "num_tokens": 7846447.0, + "step": 3360 + }, + { + "epoch": 8.35865504358655, + "eval_entropy": 0.24093415042342142, + "eval_loss": 0.9006755352020264, + "eval_mean_token_accuracy": 0.852174230786257, + "eval_num_tokens": 7846447.0, + "eval_runtime": 85.9011, + "eval_samples_per_second": 16.007, + "eval_steps_per_second": 2.002, + "step": 3360 + }, + { + "entropy": 0.13125578537583352, + "epoch": 8.408468244084682, + "grad_norm": 0.1662452220916748, + "learning_rate": 1.70774397565298e-05, + "loss": 0.06685600876808166, + "mean_token_accuracy": 0.9744067586958408, + "num_tokens": 7890283.0, + "step": 3380 + }, + { + "epoch": 8.408468244084682, + "eval_entropy": 0.24062153688350388, + "eval_loss": 0.9078915119171143, + "eval_mean_token_accuracy": 0.8523201647886011, + "eval_num_tokens": 7890283.0, + "eval_runtime": 86.0201, + "eval_samples_per_second": 15.985, + "eval_steps_per_second": 2.0, + "step": 3380 + }, + { + "entropy": 0.11986117120832204, + "epoch": 8.458281444582815, + "grad_norm": 0.19571948051452637, + "learning_rate": 1.6053957711060606e-05, + "loss": 0.06411095261573792, + "mean_token_accuracy": 0.9770627245306969, + "num_tokens": 7936518.0, + "step": 3400 + }, + { + "epoch": 8.458281444582815, + "eval_entropy": 0.24352820347561394, + "eval_loss": 0.9058943390846252, + "eval_mean_token_accuracy": 0.8519382792156797, + "eval_num_tokens": 7936518.0, + "eval_runtime": 85.966, + "eval_samples_per_second": 15.995, + "eval_steps_per_second": 2.001, + "step": 3400 + }, + { + "entropy": 0.12857897616922856, + "epoch": 8.508094645080947, + "grad_norm": 0.2609264850616455, + "learning_rate": 1.5059755409867613e-05, + "loss": 0.06473397612571716, + "mean_token_accuracy": 0.9764650195837021, + "num_tokens": 7981966.0, + "step": 3420 + }, + { + "epoch": 8.508094645080947, + "eval_entropy": 0.24032609000108962, + "eval_loss": 0.9077776074409485, + "eval_mean_token_accuracy": 0.8517829197090726, + "eval_num_tokens": 7981966.0, + "eval_runtime": 86.6059, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 3420 + }, + { + "entropy": 0.12348870886489749, + "epoch": 8.557907845579079, + "grad_norm": 0.19537609815597534, + "learning_rate": 1.409513269080473e-05, + "loss": 0.06481348872184753, + "mean_token_accuracy": 0.9769559659063816, + "num_tokens": 8028367.0, + "step": 3440 + }, + { + "epoch": 8.557907845579079, + "eval_entropy": 0.2404322574824788, + "eval_loss": 0.9057720899581909, + "eval_mean_token_accuracy": 0.8521037981953732, + "eval_num_tokens": 8028367.0, + "eval_runtime": 86.166, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.996, + "step": 3440 + }, + { + "entropy": 0.12040232736617326, + "epoch": 8.607721046077211, + "grad_norm": 0.3310582935810089, + "learning_rate": 1.3160380470927183e-05, + "loss": 0.06468871235847473, + "mean_token_accuracy": 0.9768650442361831, + "num_tokens": 8074934.0, + "step": 3460 + }, + { + "epoch": 8.607721046077211, + "eval_entropy": 0.24118655876711356, + "eval_loss": 0.9028318524360657, + "eval_mean_token_accuracy": 0.8521025340224422, + "eval_num_tokens": 8074934.0, + "eval_runtime": 85.3668, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.015, + "step": 3460 + }, + { + "entropy": 0.12328103906475008, + "epoch": 8.657534246575342, + "grad_norm": 0.12836167216300964, + "learning_rate": 1.2255780658755122e-05, + "loss": 0.06229386329650879, + "mean_token_accuracy": 0.9763277888298034, + "num_tokens": 8122775.0, + "step": 3480 + }, + { + "epoch": 8.657534246575342, + "eval_entropy": 0.24194598145956217, + "eval_loss": 0.9009329080581665, + "eval_mean_token_accuracy": 0.8521693289973015, + "eval_num_tokens": 8122775.0, + "eval_runtime": 85.9415, + "eval_samples_per_second": 15.999, + "eval_steps_per_second": 2.001, + "step": 3480 + }, + { + "entropy": 0.11321646976284683, + "epoch": 8.707347447073474, + "grad_norm": 0.15656894445419312, + "learning_rate": 1.1381606069253786e-05, + "loss": 0.05908188819885254, + "mean_token_accuracy": 0.9779504477977753, + "num_tokens": 8174307.0, + "step": 3500 + }, + { + "epoch": 8.707347447073474, + "eval_entropy": 0.24121542517528977, + "eval_loss": 0.9016091823577881, + "eval_mean_token_accuracy": 0.8521790667328724, + "eval_num_tokens": 8174307.0, + "eval_runtime": 85.7465, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.006, + "step": 3500 + }, + { + "entropy": 0.12657046681270004, + "epoch": 8.757160647571606, + "grad_norm": 0.22597502171993256, + "learning_rate": 1.053812034155629e-05, + "loss": 0.06244581937789917, + "mean_token_accuracy": 0.976795207709074, + "num_tokens": 8222808.0, + "step": 3520 + }, + { + "epoch": 8.757160647571606, + "eval_entropy": 0.23877542708502258, + "eval_loss": 0.9069110155105591, + "eval_mean_token_accuracy": 0.8522880177858264, + "eval_num_tokens": 8222808.0, + "eval_runtime": 85.7792, + "eval_samples_per_second": 16.03, + "eval_steps_per_second": 2.005, + "step": 3520 + }, + { + "entropy": 0.11422101808711886, + "epoch": 8.806973848069738, + "grad_norm": 0.21139323711395264, + "learning_rate": 9.725577859453502e-06, + "loss": 0.05988085865974426, + "mean_token_accuracy": 0.9779510758817196, + "num_tokens": 8273335.0, + "step": 3540 + }, + { + "epoch": 8.806973848069738, + "eval_entropy": 0.2393161087881687, + "eval_loss": 0.9033801555633545, + "eval_mean_token_accuracy": 0.8522614209457885, + "eval_num_tokens": 8273335.0, + "eval_runtime": 85.5594, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 3540 + }, + { + "entropy": 0.13810604228638113, + "epoch": 8.85678704856787, + "grad_norm": 0.24571993947029114, + "learning_rate": 8.944223674675537e-06, + "loss": 0.07036117911338806, + "mean_token_accuracy": 0.9734892748296261, + "num_tokens": 8315235.0, + "step": 3560 + }, + { + "epoch": 8.85678704856787, + "eval_entropy": 0.23998506947658782, + "eval_loss": 0.9009848833084106, + "eval_mean_token_accuracy": 0.8521793619837872, + "eval_num_tokens": 8315235.0, + "eval_runtime": 86.0974, + "eval_samples_per_second": 15.97, + "eval_steps_per_second": 1.998, + "step": 3560 + }, + { + "entropy": 0.14193559321574867, + "epoch": 8.906600249066003, + "grad_norm": 0.17304112017154694, + "learning_rate": 8.194293432987386e-06, + "loss": 0.07077967524528503, + "mean_token_accuracy": 0.973305893689394, + "num_tokens": 8358099.0, + "step": 3580 + }, + { + "epoch": 8.906600249066003, + "eval_entropy": 0.23883876689644748, + "eval_loss": 0.9015622138977051, + "eval_mean_token_accuracy": 0.8524864378363587, + "eval_num_tokens": 8358099.0, + "eval_runtime": 86.0089, + "eval_samples_per_second": 15.987, + "eval_steps_per_second": 2.0, + "step": 3580 + }, + { + "entropy": 0.11878943420015275, + "epoch": 8.956413449564135, + "grad_norm": 0.19075658917427063, + "learning_rate": 7.476013303121426e-06, + "loss": 0.060806107521057126, + "mean_token_accuracy": 0.9776863709092141, + "num_tokens": 8407430.0, + "step": 3600 + }, + { + "epoch": 8.956413449564135, + "eval_entropy": 0.23726526309931, + "eval_loss": 0.9060276746749878, + "eval_mean_token_accuracy": 0.8524192058762838, + "eval_num_tokens": 8407430.0, + "eval_runtime": 85.7252, + "eval_samples_per_second": 16.04, + "eval_steps_per_second": 2.006, + "step": 3600 + }, + { + "entropy": 0.1255835090787747, + "epoch": 9.004981320049813, + "grad_norm": 0.11608047038316727, + "learning_rate": 6.78959990856799e-06, + "loss": 0.06319612860679627, + "mean_token_accuracy": 0.9766685519462976, + "num_tokens": 8453175.0, + "step": 3620 + }, + { + "epoch": 9.004981320049813, + "eval_entropy": 0.2373251837006835, + "eval_loss": 0.9045722484588623, + "eval_mean_token_accuracy": 0.8525558363559634, + "eval_num_tokens": 8453175.0, + "eval_runtime": 85.7435, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.006, + "step": 3620 + }, + { + "entropy": 0.12587778437882663, + "epoch": 9.054794520547945, + "grad_norm": 0.1564614623785019, + "learning_rate": 6.135260262244683e-06, + "loss": 0.0630365788936615, + "mean_token_accuracy": 0.9777486085891723, + "num_tokens": 8497151.0, + "step": 3640 + }, + { + "epoch": 9.054794520547945, + "eval_entropy": 0.23559923721260803, + "eval_loss": 0.9120694398880005, + "eval_mean_token_accuracy": 0.8525292966947999, + "eval_num_tokens": 8497151.0, + "eval_runtime": 85.8018, + "eval_samples_per_second": 16.025, + "eval_steps_per_second": 2.005, + "step": 3640 + }, + { + "entropy": 0.12535365503281354, + "epoch": 9.104607721046078, + "grad_norm": 0.1404249221086502, + "learning_rate": 5.513191704064086e-06, + "loss": 0.060502654314041136, + "mean_token_accuracy": 0.9770058333873749, + "num_tokens": 8542996.0, + "step": 3660 + }, + { + "epoch": 9.104607721046078, + "eval_entropy": 0.23525122691725575, + "eval_loss": 0.9182237982749939, + "eval_mean_token_accuracy": 0.8524098333924316, + "eval_num_tokens": 8542996.0, + "eval_runtime": 85.9872, + "eval_samples_per_second": 15.991, + "eval_steps_per_second": 2.0, + "step": 3660 + }, + { + "entropy": 0.11330419047735632, + "epoch": 9.15442092154421, + "grad_norm": 0.15513843297958374, + "learning_rate": 4.92358184141876e-06, + "loss": 0.05822383761405945, + "mean_token_accuracy": 0.9793384782969952, + "num_tokens": 8591625.0, + "step": 3680 + }, + { + "epoch": 9.15442092154421, + "eval_entropy": 0.2353947116711805, + "eval_loss": 0.9229223132133484, + "eval_mean_token_accuracy": 0.852500357253607, + "eval_num_tokens": 8591625.0, + "eval_runtime": 86.0805, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.998, + "step": 3680 + }, + { + "entropy": 0.11830627010203898, + "epoch": 9.204234122042342, + "grad_norm": 0.1730550080537796, + "learning_rate": 4.366608492601456e-06, + "loss": 0.05860854983329773, + "mean_token_accuracy": 0.9779663667082786, + "num_tokens": 8639845.0, + "step": 3700 + }, + { + "epoch": 9.204234122042342, + "eval_entropy": 0.23567205719476522, + "eval_loss": 0.9269373416900635, + "eval_mean_token_accuracy": 0.8523658004611038, + "eval_num_tokens": 8639845.0, + "eval_runtime": 85.9809, + "eval_samples_per_second": 15.992, + "eval_steps_per_second": 2.0, + "step": 3700 + }, + { + "entropy": 0.1180900705512613, + "epoch": 9.254047322540472, + "grad_norm": 0.20909737050533295, + "learning_rate": 3.842439633177387e-06, + "loss": 0.059438884258270264, + "mean_token_accuracy": 0.9786856278777123, + "num_tokens": 8687194.0, + "step": 3720 + }, + { + "epoch": 9.254047322540472, + "eval_entropy": 0.23602714493524196, + "eval_loss": 0.9293538928031921, + "eval_mean_token_accuracy": 0.8523273440294488, + "eval_num_tokens": 8687194.0, + "eval_runtime": 85.2118, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.019, + "step": 3720 + }, + { + "entropy": 0.13156692241318524, + "epoch": 9.303860523038605, + "grad_norm": 0.12535709142684937, + "learning_rate": 3.3512333453253305e-06, + "loss": 0.06337688565254211, + "mean_token_accuracy": 0.9756712593138218, + "num_tokens": 8731721.0, + "step": 3740 + }, + { + "epoch": 9.303860523038605, + "eval_entropy": 0.23534389351343, + "eval_loss": 0.932999312877655, + "eval_mean_token_accuracy": 0.8523333925147389, + "eval_num_tokens": 8731721.0, + "eval_runtime": 85.953, + "eval_samples_per_second": 15.997, + "eval_steps_per_second": 2.001, + "step": 3740 + }, + { + "entropy": 0.12327516414225101, + "epoch": 9.353673723536737, + "grad_norm": 0.16341575980186462, + "learning_rate": 2.8931377701619306e-06, + "loss": 0.05869622826576233, + "mean_token_accuracy": 0.9784224212169648, + "num_tokens": 8778614.0, + "step": 3760 + }, + { + "epoch": 9.353673723536737, + "eval_entropy": 0.23493653622477553, + "eval_loss": 0.9358566999435425, + "eval_mean_token_accuracy": 0.8522722783476807, + "eval_num_tokens": 8778614.0, + "eval_runtime": 85.2538, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.018, + "step": 3760 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.7059314314771046e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3780/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3780/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3780/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3780/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3780/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3780/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3780/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3780/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3780/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3780/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3780/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3780/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3780/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3780/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..805cf0fa3fd3c7b64099156e5a7c2f4c426e6e7d --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3780/trainer_state.json @@ -0,0 +1,4003 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 9.403486924034869, + "eval_steps": 20, + "global_step": 3780, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + }, + { + "entropy": 0.561330484598875, + "epoch": 1.891656288916563, + "grad_norm": 0.6722865700721741, + "learning_rate": 0.0002208867897174789, + "loss": 0.499837589263916, + "mean_token_accuracy": 0.8518734864890576, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.5865232653396074, + "eval_loss": 0.5437926650047302, + "eval_mean_token_accuracy": 0.8450997017843779, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4116, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.547389242425561, + "epoch": 1.9414694894146949, + "grad_norm": 0.7935577034950256, + "learning_rate": 0.00022027119820226907, + "loss": 0.4977591514587402, + "mean_token_accuracy": 0.8539491161704064, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.5290903090391048, + "eval_loss": 0.5409526824951172, + "eval_mean_token_accuracy": 0.8497545698354411, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.7262, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 780 + }, + { + "entropy": 0.5687909748405218, + "epoch": 1.9912826899128269, + "grad_norm": 0.6180546283721924, + "learning_rate": 0.00021962329729698345, + "loss": 0.5109643459320068, + "mean_token_accuracy": 0.8521598495543004, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.5503541858390321, + "eval_loss": 0.5361555218696594, + "eval_mean_token_accuracy": 0.8510884285666221, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.3339, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 800 + }, + { + "entropy": 0.4739728841261986, + "epoch": 2.0398505603985058, + "grad_norm": 0.8058829307556152, + "learning_rate": 0.0002189432823996982, + "loss": 0.4204097747802734, + "mean_token_accuracy": 0.8728981889211215, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.5077334992414297, + "eval_loss": 0.5531114339828491, + "eval_mean_token_accuracy": 0.8489257208136625, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.4801, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.989, + "step": 820 + }, + { + "entropy": 0.4594309840351343, + "epoch": 2.0896637608966375, + "grad_norm": 0.6906896829605103, + "learning_rate": 0.0002182313585936314, + "loss": 0.4071959495544434, + "mean_token_accuracy": 0.8732857562601566, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.49850136994622474, + "eval_loss": 0.5486204624176025, + "eval_mean_token_accuracy": 0.8507991450470548, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.3364, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.4881629109382629, + "epoch": 2.1394769613947697, + "grad_norm": 0.6343470215797424, + "learning_rate": 0.0002174877405852928, + "loss": 0.41669540405273436, + "mean_token_accuracy": 0.8711295068264008, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.49155513924914734, + "eval_loss": 0.555109441280365, + "eval_mean_token_accuracy": 0.8496399400539176, + "eval_num_tokens": 2008562.0, + "eval_runtime": 86.3295, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 860 + }, + { + "entropy": 0.4648668970912695, + "epoch": 2.1892901618929015, + "grad_norm": 0.8014165163040161, + "learning_rate": 0.00021671265263973133, + "loss": 0.4110250473022461, + "mean_token_accuracy": 0.8754166305065155, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.4909258722219356, + "eval_loss": 0.5539511442184448, + "eval_mean_token_accuracy": 0.8492401502160138, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.3468, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 880 + }, + { + "entropy": 0.4824485514312983, + "epoch": 2.2391033623910337, + "grad_norm": 0.6665191054344177, + "learning_rate": 0.00021590632851289967, + "loss": 0.4181404113769531, + "mean_token_accuracy": 0.8726993151009083, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.4986876940657926, + "eval_loss": 0.547695517539978, + "eval_mean_token_accuracy": 0.8501384708770486, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.3838, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 900 + }, + { + "entropy": 0.4751896943897009, + "epoch": 2.2889165628891655, + "grad_norm": 0.81158047914505, + "learning_rate": 0.00021506901138115678, + "loss": 0.40689678192138673, + "mean_token_accuracy": 0.8745221219956875, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.507153491121392, + "eval_loss": 0.5501641631126404, + "eval_mean_token_accuracy": 0.8495670116918032, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.0912, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 920 + }, + { + "entropy": 0.4873133715242147, + "epoch": 2.3387297633872977, + "grad_norm": 0.7218056321144104, + "learning_rate": 0.0002142009537679292, + "loss": 0.42701358795166017, + "mean_token_accuracy": 0.8695114746689796, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5202612736543943, + "eval_loss": 0.5491839051246643, + "eval_mean_token_accuracy": 0.8494071208460386, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.1142, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 940 + }, + { + "entropy": 0.4762951169162989, + "epoch": 2.3885429638854294, + "grad_norm": 0.7194424867630005, + "learning_rate": 0.0002133024174675534, + "loss": 0.42299847602844237, + "mean_token_accuracy": 0.8709790132939815, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4899340462546016, + "eval_loss": 0.5522511601448059, + "eval_mean_token_accuracy": 0.8492208258357159, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.463, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 960 + }, + { + "entropy": 0.49650347977876663, + "epoch": 2.4383561643835616, + "grad_norm": 0.8406022787094116, + "learning_rate": 0.0002123736734663221, + "loss": 0.4275330066680908, + "mean_token_accuracy": 0.8670595556497573, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.49691385654515996, + "eval_loss": 0.5491269826889038, + "eval_mean_token_accuracy": 0.850309816210769, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.17, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 980 + }, + { + "entropy": 0.48843890577554705, + "epoch": 2.488169364881694, + "grad_norm": 0.9082473516464233, + "learning_rate": 0.00021141500186075868, + "loss": 0.4309722423553467, + "mean_token_accuracy": 0.8686766296625137, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5543508351195691, + "eval_loss": 0.5478800535202026, + "eval_mean_token_accuracy": 0.8478029522784921, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.3835, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 1000 + }, + { + "entropy": 0.4777219031006098, + "epoch": 2.5379825653798256, + "grad_norm": 0.7448089122772217, + "learning_rate": 0.0002104266917731438, + "loss": 0.423325252532959, + "mean_token_accuracy": 0.8706337086856365, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.49857561550168106, + "eval_loss": 0.5511948466300964, + "eval_mean_token_accuracy": 0.8502220289651737, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.5399, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.988, + "step": 1020 + }, + { + "entropy": 0.4844174191355705, + "epoch": 2.587795765877958, + "grad_norm": 0.794029176235199, + "learning_rate": 0.00020940904126432, + "loss": 0.4176753044128418, + "mean_token_accuracy": 0.873535567522049, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.485467542222766, + "eval_loss": 0.5539286732673645, + "eval_mean_token_accuracy": 0.8495475081510322, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.135, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 1.997, + "step": 1040 + }, + { + "entropy": 0.49070929251611234, + "epoch": 2.6376089663760895, + "grad_norm": 0.7558256983757019, + "learning_rate": 0.0002083623572438007, + "loss": 0.42867293357849123, + "mean_token_accuracy": 0.8696666076779366, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.490822730889154, + "eval_loss": 0.5434785485267639, + "eval_mean_token_accuracy": 0.850568296950917, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.4933, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 1060 + }, + { + "entropy": 0.47806114703416824, + "epoch": 2.6874221668742218, + "grad_norm": 0.6608979105949402, + "learning_rate": 0.00020728695537721047, + "loss": 0.4289727687835693, + "mean_token_accuracy": 0.8693130135536193, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.5285773256490397, + "eval_loss": 0.5444230437278748, + "eval_mean_token_accuracy": 0.8498796481032704, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.7091, + "eval_samples_per_second": 15.858, + "eval_steps_per_second": 1.984, + "step": 1080 + }, + { + "entropy": 0.5046216730028391, + "epoch": 2.7372353673723535, + "grad_norm": 0.8428544998168945, + "learning_rate": 0.00020618315999108454, + "loss": 0.43131070137023925, + "mean_token_accuracy": 0.8701941035687923, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.49888394738352576, + "eval_loss": 0.5459766387939453, + "eval_mean_token_accuracy": 0.8511758872935938, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.2222, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.995, + "step": 1100 + }, + { + "entropy": 0.5212558470666409, + "epoch": 2.7870485678704857, + "grad_norm": 1.129318118095398, + "learning_rate": 0.00020505130397505635, + "loss": 0.44249300956726073, + "mean_token_accuracy": 0.8654101334512234, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5179622324053631, + "eval_loss": 0.5522801280021667, + "eval_mean_token_accuracy": 0.8497019947268242, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.1903, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.996, + "step": 1120 + }, + { + "entropy": 0.4988406613469124, + "epoch": 2.8368617683686175, + "grad_norm": 0.6460545063018799, + "learning_rate": 0.00020389172868146263, + "loss": 0.4386270523071289, + "mean_token_accuracy": 0.8690383620560169, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.5042278484203094, + "eval_loss": 0.5433034300804138, + "eval_mean_token_accuracy": 0.8497674451317898, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.3028, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.993, + "step": 1140 + }, + { + "entropy": 0.4926559619605541, + "epoch": 2.8866749688667497, + "grad_norm": 0.8199329972267151, + "learning_rate": 0.00020270478382239615, + "loss": 0.4313485145568848, + "mean_token_accuracy": 0.8674727231264114, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.503873193160046, + "eval_loss": 0.5388111472129822, + "eval_mean_token_accuracy": 0.8526195034731266, + "eval_num_tokens": 2710196.0, + "eval_runtime": 86.4054, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.991, + "step": 1160 + }, + { + "entropy": 0.5020013231784105, + "epoch": 2.936488169364882, + "grad_norm": 0.7344821095466614, + "learning_rate": 0.00020149082736423723, + "loss": 0.43590536117553713, + "mean_token_accuracy": 0.8671772189438343, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5368241809828337, + "eval_loss": 0.5355703830718994, + "eval_mean_token_accuracy": 0.8517617773871089, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.2945, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1180 + }, + { + "entropy": 0.5112275708466768, + "epoch": 2.9863013698630136, + "grad_norm": 0.6951606869697571, + "learning_rate": 0.00020025022541969622, + "loss": 0.43579301834106443, + "mean_token_accuracy": 0.8641206480562686, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.5066795706055885, + "eval_loss": 0.5415249466896057, + "eval_mean_token_accuracy": 0.8493563373421513, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.5005, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.988, + "step": 1200 + }, + { + "entropy": 0.42298635305502474, + "epoch": 3.0348692403486925, + "grad_norm": 0.8201794028282166, + "learning_rate": 0.00019898335213739863, + "loss": 0.35593905448913576, + "mean_token_accuracy": 0.889238600547497, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.4584170470750609, + "eval_loss": 0.569487452507019, + "eval_mean_token_accuracy": 0.8495814173027526, + "eval_num_tokens": 2848509.0, + "eval_runtime": 86.2281, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 1220 + }, + { + "entropy": 0.37450140453875064, + "epoch": 3.0846824408468243, + "grad_norm": 0.7308394908905029, + "learning_rate": 0.0001976905895890471, + "loss": 0.307823920249939, + "mean_token_accuracy": 0.9001288741827012, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.45185995916294497, + "eval_loss": 0.5672881603240967, + "eval_mean_token_accuracy": 0.8511318519364955, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.0819, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.998, + "step": 1240 + }, + { + "entropy": 0.3887945845723152, + "epoch": 3.1344956413449565, + "grad_norm": 0.7299330830574036, + "learning_rate": 0.0001963723276541939, + "loss": 0.32047903537750244, + "mean_token_accuracy": 0.8960984498262405, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.44865354549053105, + "eval_loss": 0.5666037201881409, + "eval_mean_token_accuracy": 0.8496572649063066, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 1260 + }, + { + "entropy": 0.39677664265036583, + "epoch": 3.1843088418430883, + "grad_norm": 0.9533219933509827, + "learning_rate": 0.00019502896390265838, + "loss": 0.3253983497619629, + "mean_token_accuracy": 0.8964207418262958, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.4641980809527774, + "eval_loss": 0.5814996957778931, + "eval_mean_token_accuracy": 0.8485886212005171, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.7784, + "eval_samples_per_second": 15.845, + "eval_steps_per_second": 1.982, + "step": 1280 + }, + { + "entropy": 0.39210722744464876, + "epoch": 3.2341220423412205, + "grad_norm": 0.7447651028633118, + "learning_rate": 0.00019366090347462545, + "loss": 0.3276803970336914, + "mean_token_accuracy": 0.8930055953562259, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43595615254585135, + "eval_loss": 0.5722188353538513, + "eval_mean_token_accuracy": 0.8501105755567551, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.5271, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 1300 + }, + { + "entropy": 0.3684127271175385, + "epoch": 3.2839352428393527, + "grad_norm": 0.6934201121330261, + "learning_rate": 0.00019226855895846078, + "loss": 0.3156379222869873, + "mean_token_accuracy": 0.8976306475698947, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.4628148723480313, + "eval_loss": 0.5631352066993713, + "eval_mean_token_accuracy": 0.8504934813394103, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.3436, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 1320 + }, + { + "entropy": 0.4073401909321547, + "epoch": 3.3337484433374844, + "grad_norm": 0.9386897683143616, + "learning_rate": 0.00019085235026627994, + "loss": 0.34265310764312745, + "mean_token_accuracy": 0.8902062118053437, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.46455050623694133, + "eval_loss": 0.5586736798286438, + "eval_mean_token_accuracy": 0.8506874702004499, + "eval_num_tokens": 3132874.0, + "eval_runtime": 86.1286, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.997, + "step": 1340 + }, + { + "entropy": 0.4046429242938757, + "epoch": 3.383561643835616, + "grad_norm": 0.9633992314338684, + "learning_rate": 0.00018941270450730836, + "loss": 0.33816893100738527, + "mean_token_accuracy": 0.8927541889250279, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.46846531660750856, + "eval_loss": 0.561501681804657, + "eval_mean_token_accuracy": 0.8496256377114806, + "eval_num_tokens": 3178055.0, + "eval_runtime": 86.685, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1360 + }, + { + "entropy": 0.39872407019138334, + "epoch": 3.4333748443337484, + "grad_norm": 0.7786458730697632, + "learning_rate": 0.00018795005585907113, + "loss": 0.33342490196228025, + "mean_token_accuracy": 0.8944805048406124, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.42709505973860273, + "eval_loss": 0.5751848220825195, + "eval_mean_token_accuracy": 0.8507290447867194, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.6892, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 1380 + }, + { + "entropy": 0.3923338124528527, + "epoch": 3.4831880448318806, + "grad_norm": 0.9305956363677979, + "learning_rate": 0.0001864648454364511, + "loss": 0.33188116550445557, + "mean_token_accuracy": 0.8943330392241478, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.4386174779298694, + "eval_loss": 0.5680831074714661, + "eval_mean_token_accuracy": 0.8513129727784977, + "eval_num_tokens": 3274096.0, + "eval_runtime": 86.2671, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 1400 + }, + { + "entropy": 0.3856233984231949, + "epoch": 3.5330012453300124, + "grad_norm": 1.0362752676010132, + "learning_rate": 0.0001849575211586545, + "loss": 0.33098697662353516, + "mean_token_accuracy": 0.8961390435695649, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4574795474493226, + "eval_loss": 0.5630439519882202, + "eval_mean_token_accuracy": 0.8520988873964133, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.6035, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 1420 + }, + { + "entropy": 0.39812871962785723, + "epoch": 3.5828144458281446, + "grad_norm": 0.7807195782661438, + "learning_rate": 0.0001834285376141247, + "loss": 0.3333771228790283, + "mean_token_accuracy": 0.8930827379226685, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.4556825893909432, + "eval_loss": 0.5689062476158142, + "eval_mean_token_accuracy": 0.8507103507601937, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.1606, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.996, + "step": 1440 + }, + { + "entropy": 0.4147744856774807, + "epoch": 3.6326276463262763, + "grad_norm": 0.6429352164268494, + "learning_rate": 0.00018187835592344443, + "loss": 0.3482560873031616, + "mean_token_accuracy": 0.8910200245678425, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.46600024540757023, + "eval_loss": 0.5609709024429321, + "eval_mean_token_accuracy": 0.8491220876227977, + "eval_num_tokens": 3415600.0, + "eval_runtime": 86.8039, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1460 + }, + { + "entropy": 0.40425071083009245, + "epoch": 3.6824408468244085, + "grad_norm": 0.8613698482513428, + "learning_rate": 0.0001803074436002682, + "loss": 0.342916464805603, + "mean_token_accuracy": 0.8916418336331844, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.43855057899342026, + "eval_loss": 0.5720968246459961, + "eval_mean_token_accuracy": 0.8500823641932288, + "eval_num_tokens": 3460471.0, + "eval_runtime": 86.6746, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1480 + }, + { + "entropy": 0.39465143866837027, + "epoch": 3.7322540473225407, + "grad_norm": 0.6285189986228943, + "learning_rate": 0.0001787162744103265, + "loss": 0.3424591779708862, + "mean_token_accuracy": 0.8906558901071548, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4509461877304454, + "eval_loss": 0.5590082406997681, + "eval_mean_token_accuracy": 0.8511747371318729, + "eval_num_tokens": 3507647.0, + "eval_runtime": 86.8126, + "eval_samples_per_second": 15.839, + "eval_steps_per_second": 1.981, + "step": 1500 + }, + { + "entropy": 0.4021005939692259, + "epoch": 3.7820672478206725, + "grad_norm": 0.8821248412132263, + "learning_rate": 0.00017710532822854468, + "loss": 0.3462103843688965, + "mean_token_accuracy": 0.889109355956316, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.4502199075596277, + "eval_loss": 0.566046416759491, + "eval_mean_token_accuracy": 0.8501714208098345, + "eval_num_tokens": 3548934.0, + "eval_runtime": 86.8336, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.981, + "step": 1520 + }, + { + "entropy": 0.4017397932708263, + "epoch": 3.8318804483188043, + "grad_norm": 0.8400952816009521, + "learning_rate": 0.0001754750908943189, + "loss": 0.34890995025634763, + "mean_token_accuracy": 0.8892098367214203, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.4614003023435903, + "eval_loss": 0.5617933869361877, + "eval_mean_token_accuracy": 0.8515863616106122, + "eval_num_tokens": 3597186.0, + "eval_runtime": 86.4609, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 1540 + }, + { + "entropy": 0.4112051840871572, + "epoch": 3.8816936488169365, + "grad_norm": 0.769478440284729, + "learning_rate": 0.0001738260540649939, + "loss": 0.34711437225341796, + "mean_token_accuracy": 0.8911717928946018, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4540443811998811, + "eval_loss": 0.5576469898223877, + "eval_mean_token_accuracy": 0.8512079674144124, + "eval_num_tokens": 3646646.0, + "eval_runtime": 86.5103, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 1560 + }, + { + "entropy": 0.41105241514742374, + "epoch": 3.9315068493150687, + "grad_norm": 0.8468427062034607, + "learning_rate": 0.00017215871506758568, + "loss": 0.3433023452758789, + "mean_token_accuracy": 0.8898739732801915, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.4707539707075718, + "eval_loss": 0.5641466379165649, + "eval_mean_token_accuracy": 0.8495440957851188, + "eval_num_tokens": 3689560.0, + "eval_runtime": 86.609, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.986, + "step": 1580 + }, + { + "entropy": 0.41016379147768023, + "epoch": 3.9813200498132004, + "grad_norm": 0.7482675313949585, + "learning_rate": 0.0001704735767487946, + "loss": 0.34550890922546384, + "mean_token_accuracy": 0.8893028847873211, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.46391099864660307, + "eval_loss": 0.5593640804290771, + "eval_mean_token_accuracy": 0.8510130581467651, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.3975, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 1600 + }, + { + "entropy": 0.33167599791135544, + "epoch": 4.029887920298879, + "grad_norm": 0.9435692429542542, + "learning_rate": 0.00016877114732335337, + "loss": 0.2716026544570923, + "mean_token_accuracy": 0.9133149828666296, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.38499350005457567, + "eval_loss": 0.6298249363899231, + "eval_mean_token_accuracy": 0.8488117071778275, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.2933, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1620 + }, + { + "entropy": 0.3000166634097695, + "epoch": 4.0797011207970115, + "grad_norm": 0.8080845475196838, + "learning_rate": 0.0001670519402207569, + "loss": 0.22617182731628419, + "mean_token_accuracy": 0.9253474645316601, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.370110988703578, + "eval_loss": 0.6338461637496948, + "eval_mean_token_accuracy": 0.8485634801692741, + "eval_num_tokens": 3828830.0, + "eval_runtime": 85.9508, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.001, + "step": 1640 + }, + { + "entropy": 0.2986910421401262, + "epoch": 4.129514321295143, + "grad_norm": 0.7310900092124939, + "learning_rate": 0.0001653164739304185, + "loss": 0.22367463111877442, + "mean_token_accuracy": 0.9252275295555592, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.3944379702037157, + "eval_loss": 0.6109381914138794, + "eval_mean_token_accuracy": 0.849291454220927, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.6728, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1660 + }, + { + "entropy": 0.3095553796738386, + "epoch": 4.179327521793275, + "grad_norm": 0.7059140801429749, + "learning_rate": 0.0001635652718453007, + "loss": 0.23651680946350098, + "mean_token_accuracy": 0.9208931416273117, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.3910588648949945, + "eval_loss": 0.6104469299316406, + "eval_mean_token_accuracy": 0.8486883893262508, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7612, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.982, + "step": 1680 + }, + { + "entropy": 0.3001101028174162, + "epoch": 4.229140722291407, + "grad_norm": 0.6787802577018738, + "learning_rate": 0.00016179886210406728, + "loss": 0.23130471706390382, + "mean_token_accuracy": 0.9233332790434361, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3794369170832079, + "eval_loss": 0.6182110905647278, + "eval_mean_token_accuracy": 0.8495433777570724, + "eval_num_tokens": 3967474.0, + "eval_runtime": 85.94, + "eval_samples_per_second": 16.0, + "eval_steps_per_second": 2.001, + "step": 1700 + }, + { + "entropy": 0.3031421799212694, + "epoch": 4.2789539227895395, + "grad_norm": 0.9732038378715515, + "learning_rate": 0.0001600177774318036, + "loss": 0.2359529733657837, + "mean_token_accuracy": 0.9217648565769195, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3923123094231583, + "eval_loss": 0.6057384610176086, + "eval_mean_token_accuracy": 0.8508818288182103, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7647, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.29365369994193313, + "epoch": 4.328767123287671, + "grad_norm": 0.7681498527526855, + "learning_rate": 0.0001582225549793541, + "loss": 0.2269371747970581, + "mean_token_accuracy": 0.9245341829955578, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.4011661055129628, + "eval_loss": 0.6144486665725708, + "eval_mean_token_accuracy": 0.8480324357054955, + "eval_num_tokens": 4062594.0, + "eval_runtime": 87.1306, + "eval_samples_per_second": 15.781, + "eval_steps_per_second": 1.974, + "step": 1740 + }, + { + "entropy": 0.29396994728595016, + "epoch": 4.378580323785803, + "grad_norm": 1.0001007318496704, + "learning_rate": 0.0001564137361613248, + "loss": 0.22777395248413085, + "mean_token_accuracy": 0.9262309700250626, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38518730195802314, + "eval_loss": 0.6202630400657654, + "eval_mean_token_accuracy": 0.8493869807137999, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6616, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.3096018506214023, + "epoch": 4.428393524283935, + "grad_norm": 1.0448365211486816, + "learning_rate": 0.00015459186649280024, + "loss": 0.23696351051330566, + "mean_token_accuracy": 0.9217322513461113, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.3946371126140273, + "eval_loss": 0.6079026460647583, + "eval_mean_token_accuracy": 0.8492515852978063, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6582, + "eval_samples_per_second": 15.867, + "eval_steps_per_second": 1.985, + "step": 1780 + }, + { + "entropy": 0.32619857545942066, + "epoch": 4.478206724782067, + "grad_norm": 0.7210651636123657, + "learning_rate": 0.00015275749542482337, + "loss": 0.24651215076446534, + "mean_token_accuracy": 0.9177676141262054, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.3947690814560236, + "eval_loss": 0.6065912246704102, + "eval_mean_token_accuracy": 0.8502957744653835, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.5959, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.986, + "step": 1800 + }, + { + "entropy": 0.3193941755220294, + "epoch": 4.5280199252802, + "grad_norm": 0.8281906843185425, + "learning_rate": 0.0001509111761786888, + "loss": 0.23936262130737304, + "mean_token_accuracy": 0.9201708927750587, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38704028864239537, + "eval_loss": 0.6006569266319275, + "eval_mean_token_accuracy": 0.8502406720505205, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.8059, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1820 + }, + { + "entropy": 0.3164879363030195, + "epoch": 4.577833125778331, + "grad_norm": 0.7892968654632568, + "learning_rate": 0.00014905346557909867, + "loss": 0.24541733264923096, + "mean_token_accuracy": 0.9175932116806507, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.38861122120951497, + "eval_loss": 0.6115967631340027, + "eval_mean_token_accuracy": 0.849471275196519, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.2946, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1840 + }, + { + "entropy": 0.3051785985007882, + "epoch": 4.627646326276463, + "grad_norm": 0.8109654188156128, + "learning_rate": 0.0001471849238862319, + "loss": 0.23433220386505127, + "mean_token_accuracy": 0.9206570319831371, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.37162452295076015, + "eval_loss": 0.6184061765670776, + "eval_mean_token_accuracy": 0.8501173268223918, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.6865, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1860 + }, + { + "entropy": 0.3168198253959417, + "epoch": 4.677459526774595, + "grad_norm": 0.9512342214584351, + "learning_rate": 0.0001453061146267775, + "loss": 0.23832404613494873, + "mean_token_accuracy": 0.9197044663131237, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3845940856912801, + "eval_loss": 0.606762707233429, + "eval_mean_token_accuracy": 0.8504838194957999, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.5175, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 1880 + }, + { + "entropy": 0.30791807882487776, + "epoch": 4.7272727272727275, + "grad_norm": 0.8123113512992859, + "learning_rate": 0.00014341760442398248, + "loss": 0.2395785331726074, + "mean_token_accuracy": 0.918928150832653, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.39762327222283494, + "eval_loss": 0.5994202494621277, + "eval_mean_token_accuracy": 0.8509274201337681, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.2873, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.993, + "step": 1900 + }, + { + "entropy": 0.3021434534341097, + "epoch": 4.777085927770859, + "grad_norm": 0.731787383556366, + "learning_rate": 0.000141519962826766, + "loss": 0.23494718074798585, + "mean_token_accuracy": 0.9201403826475143, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.3827026732439219, + "eval_loss": 0.5995895862579346, + "eval_mean_token_accuracy": 0.851468373523202, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.3006, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 1920 + }, + { + "entropy": 0.31626159623265265, + "epoch": 4.826899128268991, + "grad_norm": 0.8848487138748169, + "learning_rate": 0.00013961376213795132, + "loss": 0.2439030647277832, + "mean_token_accuracy": 0.9196575872600079, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.388698436839636, + "eval_loss": 0.6000174283981323, + "eval_mean_token_accuracy": 0.8518068187458571, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.8979, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.979, + "step": 1940 + }, + { + "entropy": 0.30520407035946845, + "epoch": 4.876712328767123, + "grad_norm": 0.8532460927963257, + "learning_rate": 0.00013769957724166695, + "loss": 0.23458616733551024, + "mean_token_accuracy": 0.9221912942826748, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.38777847102908203, + "eval_loss": 0.6004981398582458, + "eval_mean_token_accuracy": 0.8516481768253238, + "eval_num_tokens": 4578167.0, + "eval_runtime": 87.0777, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.975, + "step": 1960 + }, + { + "entropy": 0.3226448342204094, + "epoch": 4.926525529265255, + "grad_norm": 0.6945561766624451, + "learning_rate": 0.0001357779854299694, + "loss": 0.24048397541046143, + "mean_token_accuracy": 0.9195300146937371, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.38581624263247777, + "eval_loss": 0.6029234528541565, + "eval_mean_token_accuracy": 0.8514213260523108, + "eval_num_tokens": 4622316.0, + "eval_runtime": 85.8729, + "eval_samples_per_second": 16.012, + "eval_steps_per_second": 2.003, + "step": 1980 + }, + { + "entropy": 0.3051655298098922, + "epoch": 4.976338729763388, + "grad_norm": 0.7976452708244324, + "learning_rate": 0.00013384956622874001, + "loss": 0.23584742546081544, + "mean_token_accuracy": 0.9216851457953453, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.37913159246361533, + "eval_loss": 0.6057604551315308, + "eval_mean_token_accuracy": 0.8525801203971686, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.1145, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 2000 + }, + { + "entropy": 0.27438195240803254, + "epoch": 5.024906600249066, + "grad_norm": 0.6729586124420166, + "learning_rate": 0.0001319149012229075, + "loss": 0.19775952100753785, + "mean_token_accuracy": 0.9339428559327737, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.3448961910813354, + "eval_loss": 0.6750120520591736, + "eval_mean_token_accuracy": 0.8487970232963562, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.1169, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 2020 + }, + { + "entropy": 0.21423916313797237, + "epoch": 5.074719800747198, + "grad_norm": 0.6934391856193542, + "learning_rate": 0.00012997457388105022, + "loss": 0.1439570426940918, + "mean_token_accuracy": 0.9528236843645572, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.3570949243771475, + "eval_loss": 0.6465504169464111, + "eval_mean_token_accuracy": 0.8490785547467166, + "eval_num_tokens": 4763269.0, + "eval_runtime": 85.9574, + "eval_samples_per_second": 15.996, + "eval_steps_per_second": 2.001, + "step": 2040 + }, + { + "entropy": 0.20838565267622472, + "epoch": 5.12453300124533, + "grad_norm": 0.7286986112594604, + "learning_rate": 0.00012802916937942972, + "loss": 0.14467307329177856, + "mean_token_accuracy": 0.950994835793972, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.3452463157821533, + "eval_loss": 0.6705958843231201, + "eval_mean_token_accuracy": 0.8490352796953778, + "eval_num_tokens": 4809047.0, + "eval_runtime": 86.228, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 2060 + }, + { + "entropy": 0.20453082229942082, + "epoch": 5.174346201743462, + "grad_norm": 0.7515555620193481, + "learning_rate": 0.00012607927442550974, + "loss": 0.13732000589370727, + "mean_token_accuracy": 0.9537357829511166, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.32431264914745506, + "eval_loss": 0.6743043065071106, + "eval_mean_token_accuracy": 0.8504878629085629, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.5948, + "eval_samples_per_second": 15.879, + "eval_steps_per_second": 1.986, + "step": 2080 + }, + { + "entropy": 0.21812320686876774, + "epoch": 5.224159402241594, + "grad_norm": 0.9093465209007263, + "learning_rate": 0.0001241254770810132, + "loss": 0.14311420917510986, + "mean_token_accuracy": 0.9514068141579628, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.33086285835435225, + "eval_loss": 0.6676449179649353, + "eval_mean_token_accuracy": 0.8505287662495015, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 2100 + }, + { + "entropy": 0.2180163251236081, + "epoch": 5.273972602739726, + "grad_norm": 0.6703007221221924, + "learning_rate": 0.00012216836658457075, + "loss": 0.14803968667984008, + "mean_token_accuracy": 0.9521303348243236, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.33162341708707255, + "eval_loss": 0.6658875942230225, + "eval_mean_token_accuracy": 0.8500757605530495, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.6296, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 2120 + }, + { + "entropy": 0.22511130161583423, + "epoch": 5.323785803237858, + "grad_norm": 0.8078880906105042, + "learning_rate": 0.00012020853317401455, + "loss": 0.15228408575057983, + "mean_token_accuracy": 0.947144789993763, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3354601170434508, + "eval_loss": 0.6677829623222351, + "eval_mean_token_accuracy": 0.8482600024273229, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.4689, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.989, + "step": 2140 + }, + { + "entropy": 0.2244176059961319, + "epoch": 5.37359900373599, + "grad_norm": 0.9636075496673584, + "learning_rate": 0.00011824656790837037, + "loss": 0.15260883569717407, + "mean_token_accuracy": 0.9471467643976211, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.3381616926297199, + "eval_loss": 0.6694412231445312, + "eval_mean_token_accuracy": 0.8482369603805764, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.4147, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 2160 + }, + { + "entropy": 0.22982364390045404, + "epoch": 5.423412204234122, + "grad_norm": 0.775401771068573, + "learning_rate": 0.00011628306248960262, + "loss": 0.15140302181243898, + "mean_token_accuracy": 0.9492553934454918, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.3305150235808173, + "eval_loss": 0.6717822551727295, + "eval_mean_token_accuracy": 0.8489849723355715, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.4728, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.989, + "step": 2180 + }, + { + "entropy": 0.21448935717344284, + "epoch": 5.473225404732254, + "grad_norm": 0.6575281023979187, + "learning_rate": 0.00011431860908416465, + "loss": 0.1452319622039795, + "mean_token_accuracy": 0.9505287684500218, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3488145174328671, + "eval_loss": 0.6612305641174316, + "eval_mean_token_accuracy": 0.8492907808963642, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6927, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 2200 + }, + { + "entropy": 0.23091202937066554, + "epoch": 5.523038605230386, + "grad_norm": 0.8909686207771301, + "learning_rate": 0.00011235380014440985, + "loss": 0.15150139331817628, + "mean_token_accuracy": 0.9497875183820724, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.3268539015810157, + "eval_loss": 0.6667542457580566, + "eval_mean_token_accuracy": 0.8499062903398691, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.4644, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 2220 + }, + { + "entropy": 0.2227974807843566, + "epoch": 5.572851805728518, + "grad_norm": 0.6180275082588196, + "learning_rate": 0.0001103892282299158, + "loss": 0.1491069197654724, + "mean_token_accuracy": 0.9488144010305405, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3346347655494546, + "eval_loss": 0.6665948629379272, + "eval_mean_token_accuracy": 0.8499961893918903, + "eval_num_tokens": 5226864.0, + "eval_runtime": 87.0548, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.976, + "step": 2240 + }, + { + "entropy": 0.21368421968072654, + "epoch": 5.62266500622665, + "grad_norm": 0.6004369258880615, + "learning_rate": 0.00010842548582877651, + "loss": 0.14485255479812623, + "mean_token_accuracy": 0.9502056457102299, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.32753298804163933, + "eval_loss": 0.6680151224136353, + "eval_mean_token_accuracy": 0.8515451086121936, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.8524, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.98, + "step": 2260 + }, + { + "entropy": 0.2103635374456644, + "epoch": 5.672478206724782, + "grad_norm": 0.699174702167511, + "learning_rate": 0.00010646316517891613, + "loss": 0.14297772645950318, + "mean_token_accuracy": 0.9512537539005279, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.32966585959806, + "eval_loss": 0.675578773021698, + "eval_mean_token_accuracy": 0.8509623023659684, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.4518, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.99, + "step": 2280 + }, + { + "entropy": 0.22516900151968003, + "epoch": 5.722291407222914, + "grad_norm": 0.6637354493141174, + "learning_rate": 0.00010450285808947797, + "loss": 0.15202572345733642, + "mean_token_accuracy": 0.9482452072203159, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3369456917740578, + "eval_loss": 0.6697061061859131, + "eval_mean_token_accuracy": 0.848603522361711, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.6371, + "eval_samples_per_second": 15.871, + "eval_steps_per_second": 1.985, + "step": 2300 + }, + { + "entropy": 0.21841065725311637, + "epoch": 5.772104607721046, + "grad_norm": 0.7940268516540527, + "learning_rate": 0.00010254515576234297, + "loss": 0.14710167646408082, + "mean_token_accuracy": 0.9493498183786869, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3237486180177955, + "eval_loss": 0.6779657602310181, + "eval_mean_token_accuracy": 0.8500715313955794, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.1826, + "eval_samples_per_second": 15.954, + "eval_steps_per_second": 1.996, + "step": 2320 + }, + { + "entropy": 0.22146204356104135, + "epoch": 5.821917808219178, + "grad_norm": 0.9234833121299744, + "learning_rate": 0.00010059064861383132, + "loss": 0.14720046520233154, + "mean_token_accuracy": 0.9493872679769992, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.32365207564692167, + "eval_loss": 0.6704005002975464, + "eval_mean_token_accuracy": 0.8507985760306203, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.5494, + "eval_samples_per_second": 15.887, + "eval_steps_per_second": 1.987, + "step": 2340 + }, + { + "entropy": 0.20934011954814197, + "epoch": 5.87173100871731, + "grad_norm": 0.5547503232955933, + "learning_rate": 9.863992609664084e-05, + "loss": 0.1464867353439331, + "mean_token_accuracy": 0.9503875687718392, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.3330401429083458, + "eval_loss": 0.6659091114997864, + "eval_mean_token_accuracy": 0.8504848906467127, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.5855, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 2360 + }, + { + "entropy": 0.21678635366261007, + "epoch": 5.921544209215442, + "grad_norm": 0.570612907409668, + "learning_rate": 9.669357652207635e-05, + "loss": 0.14821385145187377, + "mean_token_accuracy": 0.9503940217196941, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3322022325077722, + "eval_loss": 0.6722489595413208, + "eval_mean_token_accuracy": 0.8489979422369669, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.2986, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 2380 + }, + { + "entropy": 0.20932920072227718, + "epoch": 5.971357409713574, + "grad_norm": 0.7879557609558105, + "learning_rate": 9.475218688262262e-05, + "loss": 0.14675841331481934, + "mean_token_accuracy": 0.9507176131010056, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.3199348642902319, + "eval_loss": 0.6698136329650879, + "eval_mean_token_accuracy": 0.8514142130003419, + "eval_num_tokens": 5605400.0, + "eval_runtime": 85.8995, + "eval_samples_per_second": 16.007, + "eval_steps_per_second": 2.002, + "step": 2400 + }, + { + "entropy": 0.21032143919131693, + "epoch": 6.019925280199253, + "grad_norm": 0.5823076367378235, + "learning_rate": 9.281634267491569e-05, + "loss": 0.13322267532348633, + "mean_token_accuracy": 0.9550939072401096, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.30206270117399303, + "eval_loss": 0.7093168497085571, + "eval_mean_token_accuracy": 0.8500627639681794, + "eval_num_tokens": 5648968.0, + "eval_runtime": 85.8128, + "eval_samples_per_second": 16.023, + "eval_steps_per_second": 2.004, + "step": 2420 + }, + { + "entropy": 0.1534628233872354, + "epoch": 6.069738480697385, + "grad_norm": 0.710133969783783, + "learning_rate": 9.088662772316508e-05, + "loss": 0.09078952670097351, + "mean_token_accuracy": 0.9678447999060154, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.28208133101809857, + "eval_loss": 0.7636417150497437, + "eval_mean_token_accuracy": 0.8494061477655588, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9724, + "eval_samples_per_second": 15.994, + "eval_steps_per_second": 2.001, + "step": 2440 + }, + { + "entropy": 0.16151462448760867, + "epoch": 6.119551681195516, + "grad_norm": 0.5793812274932861, + "learning_rate": 8.896362400308028e-05, + "loss": 0.09545697569847107, + "mean_token_accuracy": 0.9671573750674725, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.2833245605403601, + "eval_loss": 0.7402405738830566, + "eval_mean_token_accuracy": 0.8503523728875226, + "eval_num_tokens": 5745090.0, + "eval_runtime": 85.5461, + "eval_samples_per_second": 16.073, + "eval_steps_per_second": 2.011, + "step": 2460 + }, + { + "entropy": 0.15203177919611335, + "epoch": 6.169364881693649, + "grad_norm": 0.4251123368740082, + "learning_rate": 8.704791146635483e-05, + "loss": 0.09420782327651978, + "mean_token_accuracy": 0.9677386932075024, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.28572545962971313, + "eval_loss": 0.735416829586029, + "eval_mean_token_accuracy": 0.8487084663884584, + "eval_num_tokens": 5790333.0, + "eval_runtime": 85.4801, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.012, + "step": 2480 + }, + { + "entropy": 0.15587336672469973, + "epoch": 6.219178082191781, + "grad_norm": 0.4357028007507324, + "learning_rate": 8.514006786576085e-05, + "loss": 0.09429320096969604, + "mean_token_accuracy": 0.9682952925562859, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.2859006894882335, + "eval_loss": 0.7347224950790405, + "eval_mean_token_accuracy": 0.8501905518215757, + "eval_num_tokens": 5837321.0, + "eval_runtime": 85.7578, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.006, + "step": 2500 + }, + { + "entropy": 0.15765639198943973, + "epoch": 6.268991282689913, + "grad_norm": 0.47331130504608154, + "learning_rate": 8.324066858090663e-05, + "loss": 0.09571113586425781, + "mean_token_accuracy": 0.9683481335639954, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.29231513846059176, + "eval_loss": 0.7392512559890747, + "eval_mean_token_accuracy": 0.8486633983462356, + "eval_num_tokens": 5884398.0, + "eval_runtime": 85.7846, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.005, + "step": 2520 + }, + { + "entropy": 0.16176860257983208, + "epoch": 6.318804483188045, + "grad_norm": 0.6142018437385559, + "learning_rate": 8.135028644470992e-05, + "loss": 0.09486144185066223, + "mean_token_accuracy": 0.9682316601276397, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.2851274753379267, + "eval_loss": 0.7520816922187805, + "eval_mean_token_accuracy": 0.8501113649717597, + "eval_num_tokens": 5929876.0, + "eval_runtime": 85.9425, + "eval_samples_per_second": 15.999, + "eval_steps_per_second": 2.001, + "step": 2540 + }, + { + "entropy": 0.15404034564271568, + "epoch": 6.3686176836861765, + "grad_norm": 0.6051287651062012, + "learning_rate": 7.946949157063964e-05, + "loss": 0.09280472993850708, + "mean_token_accuracy": 0.9684635892510414, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28802703563557114, + "eval_loss": 0.7439162135124207, + "eval_mean_token_accuracy": 0.8499851770872293, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.0703, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.998, + "step": 2560 + }, + { + "entropy": 0.15343588953837753, + "epoch": 6.418430884184309, + "grad_norm": 0.4823743402957916, + "learning_rate": 7.759885118077701e-05, + "loss": 0.09000591039657593, + "mean_token_accuracy": 0.9699928767979145, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2795634938533916, + "eval_loss": 0.7647850513458252, + "eval_mean_token_accuracy": 0.8503464397995971, + "eval_num_tokens": 6025380.0, + "eval_runtime": 85.8886, + "eval_samples_per_second": 16.009, + "eval_steps_per_second": 2.003, + "step": 2580 + }, + { + "entropy": 0.15740026142448188, + "epoch": 6.468244084682441, + "grad_norm": 0.5082696676254272, + "learning_rate": 7.57389294347494e-05, + "loss": 0.09191849827766418, + "mean_token_accuracy": 0.9692809768021107, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2913342311458532, + "eval_loss": 0.7518694996833801, + "eval_mean_token_accuracy": 0.8483168302580367, + "eval_num_tokens": 6073349.0, + "eval_runtime": 85.5761, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.01, + "step": 2600 + }, + { + "entropy": 0.15922069251537324, + "epoch": 6.518057285180573, + "grad_norm": 0.3995199501514435, + "learning_rate": 7.389028725958736e-05, + "loss": 0.09584367871284485, + "mean_token_accuracy": 0.9685114495456218, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.2863075934177221, + "eval_loss": 0.7539381384849548, + "eval_mean_token_accuracy": 0.8507507083027862, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.112, + "eval_samples_per_second": 15.968, + "eval_steps_per_second": 1.997, + "step": 2620 + }, + { + "entropy": 0.16197575423866512, + "epoch": 6.567870485678705, + "grad_norm": 0.534295380115509, + "learning_rate": 7.205348218055678e-05, + "loss": 0.0961170256137848, + "mean_token_accuracy": 0.9674530044198036, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.29021967315050057, + "eval_loss": 0.751198947429657, + "eval_mean_token_accuracy": 0.8509796344956686, + "eval_num_tokens": 6165523.0, + "eval_runtime": 85.7958, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.005, + "step": 2640 + }, + { + "entropy": 0.15261746793985367, + "epoch": 6.617683686176837, + "grad_norm": 0.5391237139701843, + "learning_rate": 7.022906815301673e-05, + "loss": 0.0926026999950409, + "mean_token_accuracy": 0.9695659473538398, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.29128045216202736, + "eval_loss": 0.7450292110443115, + "eval_mean_token_accuracy": 0.8498771443616512, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.3963, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 2660 + }, + { + "entropy": 0.16164180357009172, + "epoch": 6.667496886674969, + "grad_norm": 0.5767946243286133, + "learning_rate": 6.841759539535419e-05, + "loss": 0.09291981458663941, + "mean_token_accuracy": 0.9687136687338352, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2897637223088464, + "eval_loss": 0.7503410577774048, + "eval_mean_token_accuracy": 0.8503315164599308, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.0653, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.998, + "step": 2680 + }, + { + "entropy": 0.17062523355707526, + "epoch": 6.717310087173101, + "grad_norm": 0.4974168539047241, + "learning_rate": 6.661961022304563e-05, + "loss": 0.09713236689567566, + "mean_token_accuracy": 0.9661971725523472, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2765843396963075, + "eval_loss": 0.7604002356529236, + "eval_mean_token_accuracy": 0.8521115277395692, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.1676, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 2700 + }, + { + "entropy": 0.17544092936441302, + "epoch": 6.767123287671232, + "grad_norm": 0.5523537993431091, + "learning_rate": 6.483565488389582e-05, + "loss": 0.09709116220474243, + "mean_token_accuracy": 0.9650957375764847, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.27939334659035814, + "eval_loss": 0.7534670829772949, + "eval_mean_token_accuracy": 0.851230604010959, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.2913, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 2720 + }, + { + "entropy": 0.15991022661328316, + "epoch": 6.816936488169365, + "grad_norm": 0.478551983833313, + "learning_rate": 6.306626739450311e-05, + "loss": 0.09564646482467651, + "mean_token_accuracy": 0.9679084822535515, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.27878295491601146, + "eval_loss": 0.7519959211349487, + "eval_mean_token_accuracy": 0.8510654949864676, + "eval_num_tokens": 6397720.0, + "eval_runtime": 85.9109, + "eval_samples_per_second": 16.005, + "eval_steps_per_second": 2.002, + "step": 2740 + }, + { + "entropy": 0.16824879590421915, + "epoch": 6.866749688667497, + "grad_norm": 0.6681098937988281, + "learning_rate": 6.131198137800108e-05, + "loss": 0.0962279736995697, + "mean_token_accuracy": 0.966830012947321, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.2834690434121808, + "eval_loss": 0.751922070980072, + "eval_mean_token_accuracy": 0.8521237577809844, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.3618, + "eval_samples_per_second": 15.921, + "eval_steps_per_second": 1.992, + "step": 2760 + }, + { + "entropy": 0.1518704930320382, + "epoch": 6.916562889165629, + "grad_norm": 0.5201290249824524, + "learning_rate": 5.957332590312513e-05, + "loss": 0.09010660648345947, + "mean_token_accuracy": 0.9693463340401649, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.28485129617674404, + "eval_loss": 0.7452457547187805, + "eval_mean_token_accuracy": 0.8512036796919135, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.4524, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.99, + "step": 2780 + }, + { + "entropy": 0.15512610590085388, + "epoch": 6.966376089663761, + "grad_norm": 0.42802050709724426, + "learning_rate": 5.785082532465233e-05, + "loss": 0.09320432543754578, + "mean_token_accuracy": 0.9686134628951549, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.27554594526110693, + "eval_loss": 0.7644653916358948, + "eval_mean_token_accuracy": 0.8513738523389018, + "eval_num_tokens": 6540175.0, + "eval_runtime": 85.7609, + "eval_samples_per_second": 16.033, + "eval_steps_per_second": 2.006, + "step": 2800 + }, + { + "entropy": 0.17524497526196334, + "epoch": 7.01494396014944, + "grad_norm": 0.3330269157886505, + "learning_rate": 5.6144999125263545e-05, + "loss": 0.0895616888999939, + "mean_token_accuracy": 0.9682766932707566, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.2735865569218647, + "eval_loss": 0.768479585647583, + "eval_mean_token_accuracy": 0.8503459383581959, + "eval_num_tokens": 6583767.0, + "eval_runtime": 85.7162, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.007, + "step": 2820 + }, + { + "entropy": 0.1403565663844347, + "epoch": 7.064757160647572, + "grad_norm": 0.35613498091697693, + "learning_rate": 5.4456361758874235e-05, + "loss": 0.07551313638687134, + "mean_token_accuracy": 0.9739301167428493, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.25941789089593775, + "eval_loss": 0.8209511637687683, + "eval_mean_token_accuracy": 0.8505055855873019, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.0943, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 2840 + }, + { + "entropy": 0.13500106502324344, + "epoch": 7.114570361145703, + "grad_norm": 0.34418627619743347, + "learning_rate": 5.2785422495482234e-05, + "loss": 0.07293946146965027, + "mean_token_accuracy": 0.9747208289802074, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.26482899772912954, + "eval_loss": 0.798904538154602, + "eval_mean_token_accuracy": 0.8511530233677044, + "eval_num_tokens": 6672946.0, + "eval_runtime": 85.7915, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.005, + "step": 2860 + }, + { + "entropy": 0.13127502552233636, + "epoch": 7.164383561643835, + "grad_norm": 0.4638441503047943, + "learning_rate": 5.113268526757892e-05, + "loss": 0.07121461629867554, + "mean_token_accuracy": 0.9756786689162255, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2645381211714689, + "eval_loss": 0.809101939201355, + "eval_mean_token_accuracy": 0.8514727898115335, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.84, + "eval_samples_per_second": 16.018, + "eval_steps_per_second": 2.004, + "step": 2880 + }, + { + "entropy": 0.1331390908919275, + "epoch": 7.214196762141968, + "grad_norm": 0.40206775069236755, + "learning_rate": 4.949864851817007e-05, + "loss": 0.07188264131546021, + "mean_token_accuracy": 0.9755406074225903, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.26244733283339544, + "eval_loss": 0.8143188953399658, + "eval_mean_token_accuracy": 0.8514358189909957, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.8546, + "eval_samples_per_second": 16.015, + "eval_steps_per_second": 2.003, + "step": 2900 + }, + { + "entropy": 0.13647331558167936, + "epoch": 7.2640099626401, + "grad_norm": 0.26405787467956543, + "learning_rate": 4.788380505045224e-05, + "loss": 0.07412450313568116, + "mean_token_accuracy": 0.9744274213910102, + "num_tokens": 6809678.0, + "step": 2920 + }, + { + "epoch": 7.2640099626401, + "eval_entropy": 0.2626111418182074, + "eval_loss": 0.8111525177955627, + "eval_mean_token_accuracy": 0.8512121695418691, + "eval_num_tokens": 6809678.0, + "eval_runtime": 85.9626, + "eval_samples_per_second": 15.995, + "eval_steps_per_second": 2.001, + "step": 2920 + }, + { + "entropy": 0.12644002586603165, + "epoch": 7.313823163138232, + "grad_norm": 0.27514681220054626, + "learning_rate": 4.6288641879189884e-05, + "loss": 0.06807711124420165, + "mean_token_accuracy": 0.9760703906416893, + "num_tokens": 6860750.0, + "step": 2940 + }, + { + "epoch": 7.313823163138232, + "eval_entropy": 0.26096762734097106, + "eval_loss": 0.8184595108032227, + "eval_mean_token_accuracy": 0.8501476153384807, + "eval_num_tokens": 6860750.0, + "eval_runtime": 85.9521, + "eval_samples_per_second": 15.997, + "eval_steps_per_second": 2.001, + "step": 2940 + }, + { + "entropy": 0.13920630998909472, + "epoch": 7.363636363636363, + "grad_norm": 0.23584705591201782, + "learning_rate": 4.4713640083838604e-05, + "loss": 0.07301607131958007, + "mean_token_accuracy": 0.9745715200901032, + "num_tokens": 6907092.0, + "step": 2960 + }, + { + "epoch": 7.363636363636363, + "eval_entropy": 0.2612536767021168, + "eval_loss": 0.8116245269775391, + "eval_mean_token_accuracy": 0.8510967350976412, + "eval_num_tokens": 6907092.0, + "eval_runtime": 85.6373, + "eval_samples_per_second": 16.056, + "eval_steps_per_second": 2.008, + "step": 2960 + }, + { + "entropy": 0.1349492883309722, + "epoch": 7.4134495641344955, + "grad_norm": 0.24552719295024872, + "learning_rate": 4.315927466345791e-05, + "loss": 0.07397544980049134, + "mean_token_accuracy": 0.9745095103979111, + "num_tokens": 6952700.0, + "step": 2980 + }, + { + "epoch": 7.4134495641344955, + "eval_entropy": 0.25796533306670744, + "eval_loss": 0.8266491293907166, + "eval_mean_token_accuracy": 0.8511653857868772, + "eval_num_tokens": 6952700.0, + "eval_runtime": 85.7462, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.006, + "step": 2980 + }, + { + "entropy": 0.14479175000451505, + "epoch": 7.463262764632628, + "grad_norm": 0.2846072018146515, + "learning_rate": 4.162601439345814e-05, + "loss": 0.07544798254966736, + "mean_token_accuracy": 0.9727819666266442, + "num_tokens": 6996430.0, + "step": 3000 + }, + { + "epoch": 7.463262764632628, + "eval_entropy": 0.2584348309698493, + "eval_loss": 0.8253348469734192, + "eval_mean_token_accuracy": 0.8511569815319638, + "eval_num_tokens": 6996430.0, + "eval_runtime": 86.2984, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 3000 + }, + { + "entropy": 0.14114196319133043, + "epoch": 7.51307596513076, + "grad_norm": 0.407966285943985, + "learning_rate": 4.011432168422419e-05, + "loss": 0.0736398994922638, + "mean_token_accuracy": 0.9741654269397259, + "num_tokens": 7042038.0, + "step": 3020 + }, + { + "epoch": 7.51307596513076, + "eval_entropy": 0.25232676260693127, + "eval_loss": 0.8296052813529968, + "eval_mean_token_accuracy": 0.8523298349491385, + "eval_num_tokens": 7042038.0, + "eval_runtime": 85.8445, + "eval_samples_per_second": 16.017, + "eval_steps_per_second": 2.004, + "step": 3020 + }, + { + "entropy": 0.1353456223383546, + "epoch": 7.562889165628892, + "grad_norm": 0.2712634801864624, + "learning_rate": 3.8624652441658684e-05, + "loss": 0.07362412214279175, + "mean_token_accuracy": 0.9747945807874203, + "num_tokens": 7089390.0, + "step": 3040 + }, + { + "epoch": 7.562889165628892, + "eval_entropy": 0.2579477243991785, + "eval_loss": 0.8274564743041992, + "eval_mean_token_accuracy": 0.8517705212498821, + "eval_num_tokens": 7089390.0, + "eval_runtime": 85.8222, + "eval_samples_per_second": 16.022, + "eval_steps_per_second": 2.004, + "step": 3040 + }, + { + "entropy": 0.1296080862637609, + "epoch": 7.6127023661270234, + "grad_norm": 0.2371893972158432, + "learning_rate": 3.715745592968707e-05, + "loss": 0.06971035599708557, + "mean_token_accuracy": 0.9759043246507645, + "num_tokens": 7138002.0, + "step": 3060 + }, + { + "epoch": 7.6127023661270234, + "eval_entropy": 0.25391967083479083, + "eval_loss": 0.8197130560874939, + "eval_mean_token_accuracy": 0.8522267875283264, + "eval_num_tokens": 7138002.0, + "eval_runtime": 85.8796, + "eval_samples_per_second": 16.011, + "eval_steps_per_second": 2.003, + "step": 3060 + }, + { + "entropy": 0.1311203008517623, + "epoch": 7.662515566625156, + "grad_norm": 0.22499267756938934, + "learning_rate": 3.5713174634765967e-05, + "loss": 0.07176244258880615, + "mean_token_accuracy": 0.9754939571022987, + "num_tokens": 7185520.0, + "step": 3080 + }, + { + "epoch": 7.662515566625156, + "eval_entropy": 0.2526215241225653, + "eval_loss": 0.8265154361724854, + "eval_mean_token_accuracy": 0.8519952584837758, + "eval_num_tokens": 7185520.0, + "eval_runtime": 85.8746, + "eval_samples_per_second": 16.012, + "eval_steps_per_second": 2.003, + "step": 3080 + }, + { + "entropy": 0.13420484317466616, + "epoch": 7.712328767123288, + "grad_norm": 0.2398064285516739, + "learning_rate": 3.4292244132434866e-05, + "loss": 0.07559212446212768, + "mean_token_accuracy": 0.9743142127990723, + "num_tokens": 7232170.0, + "step": 3100 + }, + { + "epoch": 7.712328767123288, + "eval_entropy": 0.2484562756537005, + "eval_loss": 0.8312150239944458, + "eval_mean_token_accuracy": 0.8528405119513356, + "eval_num_tokens": 7232170.0, + "eval_runtime": 85.7896, + "eval_samples_per_second": 16.028, + "eval_steps_per_second": 2.005, + "step": 3100 + }, + { + "entropy": 0.11965563679113984, + "epoch": 7.76214196762142, + "grad_norm": 0.3408384919166565, + "learning_rate": 3.2895092955952746e-05, + "loss": 0.0661750853061676, + "mean_token_accuracy": 0.9776600524783134, + "num_tokens": 7282846.0, + "step": 3120 + }, + { + "epoch": 7.76214196762142, + "eval_entropy": 0.2522421533804993, + "eval_loss": 0.8327009677886963, + "eval_mean_token_accuracy": 0.8524222023958383, + "eval_num_tokens": 7282846.0, + "eval_runtime": 86.1769, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 1.996, + "step": 3120 + }, + { + "entropy": 0.13388084415346385, + "epoch": 7.811955168119551, + "grad_norm": 0.35418516397476196, + "learning_rate": 3.152214246705829e-05, + "loss": 0.07149899601936341, + "mean_token_accuracy": 0.9747635535895824, + "num_tokens": 7331518.0, + "step": 3140 + }, + { + "epoch": 7.811955168119551, + "eval_entropy": 0.25038352296795957, + "eval_loss": 0.836457371711731, + "eval_mean_token_accuracy": 0.8526130665180295, + "eval_num_tokens": 7331518.0, + "eval_runtime": 85.6099, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.009, + "step": 3140 + }, + { + "entropy": 0.13530643959529698, + "epoch": 7.861768368617684, + "grad_norm": 0.38060539960861206, + "learning_rate": 3.017380672889291e-05, + "loss": 0.07116585969924927, + "mean_token_accuracy": 0.973284512758255, + "num_tokens": 7379056.0, + "step": 3160 + }, + { + "epoch": 7.861768368617684, + "eval_entropy": 0.255092611319797, + "eval_loss": 0.8314701914787292, + "eval_mean_token_accuracy": 0.8520913099826768, + "eval_num_tokens": 7379056.0, + "eval_runtime": 85.877, + "eval_samples_per_second": 16.011, + "eval_steps_per_second": 2.003, + "step": 3160 + }, + { + "entropy": 0.13383390177041293, + "epoch": 7.911581569115816, + "grad_norm": 0.3827536106109619, + "learning_rate": 2.8850492381124808e-05, + "loss": 0.07305437326431274, + "mean_token_accuracy": 0.9750778004527092, + "num_tokens": 7424770.0, + "step": 3180 + }, + { + "epoch": 7.911581569115816, + "eval_entropy": 0.25416371157003004, + "eval_loss": 0.8206402063369751, + "eval_mean_token_accuracy": 0.852779901651449, + "eval_num_tokens": 7424770.0, + "eval_runtime": 86.1015, + "eval_samples_per_second": 15.97, + "eval_steps_per_second": 1.998, + "step": 3180 + }, + { + "entropy": 0.1395680439658463, + "epoch": 7.961394769613948, + "grad_norm": 0.3809775412082672, + "learning_rate": 2.7552598517312256e-05, + "loss": 0.07236042022705078, + "mean_token_accuracy": 0.9731538116931915, + "num_tokens": 7470804.0, + "step": 3200 + }, + { + "epoch": 7.961394769613948, + "eval_entropy": 0.25528111975899964, + "eval_loss": 0.8230037093162537, + "eval_mean_token_accuracy": 0.8526452603035195, + "eval_num_tokens": 7470804.0, + "eval_runtime": 85.7895, + "eval_samples_per_second": 16.028, + "eval_steps_per_second": 2.005, + "step": 3200 + }, + { + "entropy": 0.12193699864049752, + "epoch": 8.009962640099626, + "grad_norm": 0.11854425817728043, + "learning_rate": 2.6280516564542205e-05, + "loss": 0.06617764234542847, + "mean_token_accuracy": 0.977179691577569, + "num_tokens": 7518110.0, + "step": 3220 + }, + { + "epoch": 8.009962640099626, + "eval_entropy": 0.25100527677771656, + "eval_loss": 0.8393343687057495, + "eval_mean_token_accuracy": 0.8522553132023922, + "eval_num_tokens": 7518110.0, + "eval_runtime": 85.8837, + "eval_samples_per_second": 16.01, + "eval_steps_per_second": 2.003, + "step": 3220 + }, + { + "entropy": 0.12788885813206435, + "epoch": 8.059775840597759, + "grad_norm": 0.16094881296157837, + "learning_rate": 2.50346301653812e-05, + "loss": 0.06274186968803405, + "mean_token_accuracy": 0.9766994707286358, + "num_tokens": 7565539.0, + "step": 3240 + }, + { + "epoch": 8.059775840597759, + "eval_entropy": 0.24409458682287571, + "eval_loss": 0.874617338180542, + "eval_mean_token_accuracy": 0.8521041180505309, + "eval_num_tokens": 7565539.0, + "eval_runtime": 86.2656, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 3240 + }, + { + "entropy": 0.12464155335910618, + "epoch": 8.10958904109589, + "grad_norm": 0.16893954575061798, + "learning_rate": 2.381531506217437e-05, + "loss": 0.06093020439147949, + "mean_token_accuracy": 0.9776258453726768, + "num_tokens": 7612578.0, + "step": 3260 + }, + { + "epoch": 8.10958904109589, + "eval_entropy": 0.24396493017326953, + "eval_loss": 0.891161322593689, + "eval_mean_token_accuracy": 0.8515338024427724, + "eval_num_tokens": 7612578.0, + "eval_runtime": 85.9061, + "eval_samples_per_second": 16.006, + "eval_steps_per_second": 2.002, + "step": 3260 + }, + { + "entropy": 0.12345920228399336, + "epoch": 8.159402241594023, + "grad_norm": 0.14332273602485657, + "learning_rate": 2.262293898372616e-05, + "loss": 0.061289966106414795, + "mean_token_accuracy": 0.9762230902910233, + "num_tokens": 7660157.0, + "step": 3280 + }, + { + "epoch": 8.159402241594023, + "eval_entropy": 0.2481445314059424, + "eval_loss": 0.8922848105430603, + "eval_mean_token_accuracy": 0.8514944855556932, + "eval_num_tokens": 7660157.0, + "eval_runtime": 85.5201, + "eval_samples_per_second": 16.078, + "eval_steps_per_second": 2.011, + "step": 3280 + }, + { + "entropy": 0.12298110066913068, + "epoch": 8.209215442092155, + "grad_norm": 0.21848882734775543, + "learning_rate": 2.1457861534398633e-05, + "loss": 0.05986443758010864, + "mean_token_accuracy": 0.9786281704902648, + "num_tokens": 7709745.0, + "step": 3300 + }, + { + "epoch": 8.209215442092155, + "eval_entropy": 0.24329388124305149, + "eval_loss": 0.9021085500717163, + "eval_mean_token_accuracy": 0.8521762625422589, + "eval_num_tokens": 7709745.0, + "eval_runtime": 85.955, + "eval_samples_per_second": 15.997, + "eval_steps_per_second": 2.001, + "step": 3300 + }, + { + "entropy": 0.13265180448070168, + "epoch": 8.259028642590286, + "grad_norm": 0.18067947030067444, + "learning_rate": 2.0320434085659692e-05, + "loss": 0.06724961400032044, + "mean_token_accuracy": 0.975098168104887, + "num_tokens": 7753571.0, + "step": 3320 + }, + { + "epoch": 8.259028642590286, + "eval_entropy": 0.2433211464694766, + "eval_loss": 0.9094350337982178, + "eval_mean_token_accuracy": 0.8520150094531304, + "eval_num_tokens": 7753571.0, + "eval_runtime": 85.7989, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.005, + "step": 3320 + }, + { + "entropy": 0.11949320202693343, + "epoch": 8.308841843088418, + "grad_norm": 0.17020289599895477, + "learning_rate": 1.9210999670114196e-05, + "loss": 0.0634455680847168, + "mean_token_accuracy": 0.9771294385194779, + "num_tokens": 7799310.0, + "step": 3340 + }, + { + "epoch": 8.308841843088418, + "eval_entropy": 0.24345201219237128, + "eval_loss": 0.9021793603897095, + "eval_mean_token_accuracy": 0.8520745697409607, + "eval_num_tokens": 7799310.0, + "eval_runtime": 86.0883, + "eval_samples_per_second": 15.972, + "eval_steps_per_second": 1.998, + "step": 3340 + }, + { + "entropy": 0.12065747743472457, + "epoch": 8.35865504358655, + "grad_norm": 0.16789060831069946, + "learning_rate": 1.8129892878049886e-05, + "loss": 0.061494195461273195, + "mean_token_accuracy": 0.9779584899544715, + "num_tokens": 7846447.0, + "step": 3360 + }, + { + "epoch": 8.35865504358655, + "eval_entropy": 0.24093415042342142, + "eval_loss": 0.9006755352020264, + "eval_mean_token_accuracy": 0.852174230786257, + "eval_num_tokens": 7846447.0, + "eval_runtime": 85.9011, + "eval_samples_per_second": 16.007, + "eval_steps_per_second": 2.002, + "step": 3360 + }, + { + "entropy": 0.13125578537583352, + "epoch": 8.408468244084682, + "grad_norm": 0.1662452220916748, + "learning_rate": 1.70774397565298e-05, + "loss": 0.06685600876808166, + "mean_token_accuracy": 0.9744067586958408, + "num_tokens": 7890283.0, + "step": 3380 + }, + { + "epoch": 8.408468244084682, + "eval_entropy": 0.24062153688350388, + "eval_loss": 0.9078915119171143, + "eval_mean_token_accuracy": 0.8523201647886011, + "eval_num_tokens": 7890283.0, + "eval_runtime": 86.0201, + "eval_samples_per_second": 15.985, + "eval_steps_per_second": 2.0, + "step": 3380 + }, + { + "entropy": 0.11986117120832204, + "epoch": 8.458281444582815, + "grad_norm": 0.19571948051452637, + "learning_rate": 1.6053957711060606e-05, + "loss": 0.06411095261573792, + "mean_token_accuracy": 0.9770627245306969, + "num_tokens": 7936518.0, + "step": 3400 + }, + { + "epoch": 8.458281444582815, + "eval_entropy": 0.24352820347561394, + "eval_loss": 0.9058943390846252, + "eval_mean_token_accuracy": 0.8519382792156797, + "eval_num_tokens": 7936518.0, + "eval_runtime": 85.966, + "eval_samples_per_second": 15.995, + "eval_steps_per_second": 2.001, + "step": 3400 + }, + { + "entropy": 0.12857897616922856, + "epoch": 8.508094645080947, + "grad_norm": 0.2609264850616455, + "learning_rate": 1.5059755409867613e-05, + "loss": 0.06473397612571716, + "mean_token_accuracy": 0.9764650195837021, + "num_tokens": 7981966.0, + "step": 3420 + }, + { + "epoch": 8.508094645080947, + "eval_entropy": 0.24032609000108962, + "eval_loss": 0.9077776074409485, + "eval_mean_token_accuracy": 0.8517829197090726, + "eval_num_tokens": 7981966.0, + "eval_runtime": 86.6059, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 3420 + }, + { + "entropy": 0.12348870886489749, + "epoch": 8.557907845579079, + "grad_norm": 0.19537609815597534, + "learning_rate": 1.409513269080473e-05, + "loss": 0.06481348872184753, + "mean_token_accuracy": 0.9769559659063816, + "num_tokens": 8028367.0, + "step": 3440 + }, + { + "epoch": 8.557907845579079, + "eval_entropy": 0.2404322574824788, + "eval_loss": 0.9057720899581909, + "eval_mean_token_accuracy": 0.8521037981953732, + "eval_num_tokens": 8028367.0, + "eval_runtime": 86.166, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.996, + "step": 3440 + }, + { + "entropy": 0.12040232736617326, + "epoch": 8.607721046077211, + "grad_norm": 0.3310582935810089, + "learning_rate": 1.3160380470927183e-05, + "loss": 0.06468871235847473, + "mean_token_accuracy": 0.9768650442361831, + "num_tokens": 8074934.0, + "step": 3460 + }, + { + "epoch": 8.607721046077211, + "eval_entropy": 0.24118655876711356, + "eval_loss": 0.9028318524360657, + "eval_mean_token_accuracy": 0.8521025340224422, + "eval_num_tokens": 8074934.0, + "eval_runtime": 85.3668, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.015, + "step": 3460 + }, + { + "entropy": 0.12328103906475008, + "epoch": 8.657534246575342, + "grad_norm": 0.12836167216300964, + "learning_rate": 1.2255780658755122e-05, + "loss": 0.06229386329650879, + "mean_token_accuracy": 0.9763277888298034, + "num_tokens": 8122775.0, + "step": 3480 + }, + { + "epoch": 8.657534246575342, + "eval_entropy": 0.24194598145956217, + "eval_loss": 0.9009329080581665, + "eval_mean_token_accuracy": 0.8521693289973015, + "eval_num_tokens": 8122775.0, + "eval_runtime": 85.9415, + "eval_samples_per_second": 15.999, + "eval_steps_per_second": 2.001, + "step": 3480 + }, + { + "entropy": 0.11321646976284683, + "epoch": 8.707347447073474, + "grad_norm": 0.15656894445419312, + "learning_rate": 1.1381606069253786e-05, + "loss": 0.05908188819885254, + "mean_token_accuracy": 0.9779504477977753, + "num_tokens": 8174307.0, + "step": 3500 + }, + { + "epoch": 8.707347447073474, + "eval_entropy": 0.24121542517528977, + "eval_loss": 0.9016091823577881, + "eval_mean_token_accuracy": 0.8521790667328724, + "eval_num_tokens": 8174307.0, + "eval_runtime": 85.7465, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.006, + "step": 3500 + }, + { + "entropy": 0.12657046681270004, + "epoch": 8.757160647571606, + "grad_norm": 0.22597502171993256, + "learning_rate": 1.053812034155629e-05, + "loss": 0.06244581937789917, + "mean_token_accuracy": 0.976795207709074, + "num_tokens": 8222808.0, + "step": 3520 + }, + { + "epoch": 8.757160647571606, + "eval_entropy": 0.23877542708502258, + "eval_loss": 0.9069110155105591, + "eval_mean_token_accuracy": 0.8522880177858264, + "eval_num_tokens": 8222808.0, + "eval_runtime": 85.7792, + "eval_samples_per_second": 16.03, + "eval_steps_per_second": 2.005, + "step": 3520 + }, + { + "entropy": 0.11422101808711886, + "epoch": 8.806973848069738, + "grad_norm": 0.21139323711395264, + "learning_rate": 9.725577859453502e-06, + "loss": 0.05988085865974426, + "mean_token_accuracy": 0.9779510758817196, + "num_tokens": 8273335.0, + "step": 3540 + }, + { + "epoch": 8.806973848069738, + "eval_entropy": 0.2393161087881687, + "eval_loss": 0.9033801555633545, + "eval_mean_token_accuracy": 0.8522614209457885, + "eval_num_tokens": 8273335.0, + "eval_runtime": 85.5594, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 3540 + }, + { + "entropy": 0.13810604228638113, + "epoch": 8.85678704856787, + "grad_norm": 0.24571993947029114, + "learning_rate": 8.944223674675537e-06, + "loss": 0.07036117911338806, + "mean_token_accuracy": 0.9734892748296261, + "num_tokens": 8315235.0, + "step": 3560 + }, + { + "epoch": 8.85678704856787, + "eval_entropy": 0.23998506947658782, + "eval_loss": 0.9009848833084106, + "eval_mean_token_accuracy": 0.8521793619837872, + "eval_num_tokens": 8315235.0, + "eval_runtime": 86.0974, + "eval_samples_per_second": 15.97, + "eval_steps_per_second": 1.998, + "step": 3560 + }, + { + "entropy": 0.14193559321574867, + "epoch": 8.906600249066003, + "grad_norm": 0.17304112017154694, + "learning_rate": 8.194293432987386e-06, + "loss": 0.07077967524528503, + "mean_token_accuracy": 0.973305893689394, + "num_tokens": 8358099.0, + "step": 3580 + }, + { + "epoch": 8.906600249066003, + "eval_entropy": 0.23883876689644748, + "eval_loss": 0.9015622138977051, + "eval_mean_token_accuracy": 0.8524864378363587, + "eval_num_tokens": 8358099.0, + "eval_runtime": 86.0089, + "eval_samples_per_second": 15.987, + "eval_steps_per_second": 2.0, + "step": 3580 + }, + { + "entropy": 0.11878943420015275, + "epoch": 8.956413449564135, + "grad_norm": 0.19075658917427063, + "learning_rate": 7.476013303121426e-06, + "loss": 0.060806107521057126, + "mean_token_accuracy": 0.9776863709092141, + "num_tokens": 8407430.0, + "step": 3600 + }, + { + "epoch": 8.956413449564135, + "eval_entropy": 0.23726526309931, + "eval_loss": 0.9060276746749878, + "eval_mean_token_accuracy": 0.8524192058762838, + "eval_num_tokens": 8407430.0, + "eval_runtime": 85.7252, + "eval_samples_per_second": 16.04, + "eval_steps_per_second": 2.006, + "step": 3600 + }, + { + "entropy": 0.1255835090787747, + "epoch": 9.004981320049813, + "grad_norm": 0.11608047038316727, + "learning_rate": 6.78959990856799e-06, + "loss": 0.06319612860679627, + "mean_token_accuracy": 0.9766685519462976, + "num_tokens": 8453175.0, + "step": 3620 + }, + { + "epoch": 9.004981320049813, + "eval_entropy": 0.2373251837006835, + "eval_loss": 0.9045722484588623, + "eval_mean_token_accuracy": 0.8525558363559634, + "eval_num_tokens": 8453175.0, + "eval_runtime": 85.7435, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.006, + "step": 3620 + }, + { + "entropy": 0.12587778437882663, + "epoch": 9.054794520547945, + "grad_norm": 0.1564614623785019, + "learning_rate": 6.135260262244683e-06, + "loss": 0.0630365788936615, + "mean_token_accuracy": 0.9777486085891723, + "num_tokens": 8497151.0, + "step": 3640 + }, + { + "epoch": 9.054794520547945, + "eval_entropy": 0.23559923721260803, + "eval_loss": 0.9120694398880005, + "eval_mean_token_accuracy": 0.8525292966947999, + "eval_num_tokens": 8497151.0, + "eval_runtime": 85.8018, + "eval_samples_per_second": 16.025, + "eval_steps_per_second": 2.005, + "step": 3640 + }, + { + "entropy": 0.12535365503281354, + "epoch": 9.104607721046078, + "grad_norm": 0.1404249221086502, + "learning_rate": 5.513191704064086e-06, + "loss": 0.060502654314041136, + "mean_token_accuracy": 0.9770058333873749, + "num_tokens": 8542996.0, + "step": 3660 + }, + { + "epoch": 9.104607721046078, + "eval_entropy": 0.23525122691725575, + "eval_loss": 0.9182237982749939, + "eval_mean_token_accuracy": 0.8524098333924316, + "eval_num_tokens": 8542996.0, + "eval_runtime": 85.9872, + "eval_samples_per_second": 15.991, + "eval_steps_per_second": 2.0, + "step": 3660 + }, + { + "entropy": 0.11330419047735632, + "epoch": 9.15442092154421, + "grad_norm": 0.15513843297958374, + "learning_rate": 4.92358184141876e-06, + "loss": 0.05822383761405945, + "mean_token_accuracy": 0.9793384782969952, + "num_tokens": 8591625.0, + "step": 3680 + }, + { + "epoch": 9.15442092154421, + "eval_entropy": 0.2353947116711805, + "eval_loss": 0.9229223132133484, + "eval_mean_token_accuracy": 0.852500357253607, + "eval_num_tokens": 8591625.0, + "eval_runtime": 86.0805, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.998, + "step": 3680 + }, + { + "entropy": 0.11830627010203898, + "epoch": 9.204234122042342, + "grad_norm": 0.1730550080537796, + "learning_rate": 4.366608492601456e-06, + "loss": 0.05860854983329773, + "mean_token_accuracy": 0.9779663667082786, + "num_tokens": 8639845.0, + "step": 3700 + }, + { + "epoch": 9.204234122042342, + "eval_entropy": 0.23567205719476522, + "eval_loss": 0.9269373416900635, + "eval_mean_token_accuracy": 0.8523658004611038, + "eval_num_tokens": 8639845.0, + "eval_runtime": 85.9809, + "eval_samples_per_second": 15.992, + "eval_steps_per_second": 2.0, + "step": 3700 + }, + { + "entropy": 0.1180900705512613, + "epoch": 9.254047322540472, + "grad_norm": 0.20909737050533295, + "learning_rate": 3.842439633177387e-06, + "loss": 0.059438884258270264, + "mean_token_accuracy": 0.9786856278777123, + "num_tokens": 8687194.0, + "step": 3720 + }, + { + "epoch": 9.254047322540472, + "eval_entropy": 0.23602714493524196, + "eval_loss": 0.9293538928031921, + "eval_mean_token_accuracy": 0.8523273440294488, + "eval_num_tokens": 8687194.0, + "eval_runtime": 85.2118, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.019, + "step": 3720 + }, + { + "entropy": 0.13156692241318524, + "epoch": 9.303860523038605, + "grad_norm": 0.12535709142684937, + "learning_rate": 3.3512333453253305e-06, + "loss": 0.06337688565254211, + "mean_token_accuracy": 0.9756712593138218, + "num_tokens": 8731721.0, + "step": 3740 + }, + { + "epoch": 9.303860523038605, + "eval_entropy": 0.23534389351343, + "eval_loss": 0.932999312877655, + "eval_mean_token_accuracy": 0.8523333925147389, + "eval_num_tokens": 8731721.0, + "eval_runtime": 85.953, + "eval_samples_per_second": 15.997, + "eval_steps_per_second": 2.001, + "step": 3740 + }, + { + "entropy": 0.12327516414225101, + "epoch": 9.353673723536737, + "grad_norm": 0.16341575980186462, + "learning_rate": 2.8931377701619306e-06, + "loss": 0.05869622826576233, + "mean_token_accuracy": 0.9784224212169648, + "num_tokens": 8778614.0, + "step": 3760 + }, + { + "epoch": 9.353673723536737, + "eval_entropy": 0.23493653622477553, + "eval_loss": 0.9358566999435425, + "eval_mean_token_accuracy": 0.8522722783476807, + "eval_num_tokens": 8778614.0, + "eval_runtime": 85.2538, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.018, + "step": 3760 + }, + { + "entropy": 0.1134357453789562, + "epoch": 9.403486924034869, + "grad_norm": 0.23999616503715515, + "learning_rate": 2.4682910630645723e-06, + "loss": 0.057540220022201535, + "mean_token_accuracy": 0.9798057802021504, + "num_tokens": 8826551.0, + "step": 3780 + }, + { + "epoch": 9.403486924034869, + "eval_entropy": 0.23470525634150172, + "eval_loss": 0.937556266784668, + "eval_mean_token_accuracy": 0.8523351706044618, + "eval_num_tokens": 8826551.0, + "eval_runtime": 85.7764, + "eval_samples_per_second": 16.03, + "eval_steps_per_second": 2.005, + "step": 3780 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.725921460999721e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-380/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-380/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-380/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-380/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-380/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-380/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-380/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-380/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-380/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-380/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-380/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-380/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-380/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-380/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..3e77dba870644dcbbf2e0db9cc4cc05ae0857465 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-380/trainer_state.json @@ -0,0 +1,433 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 0.9464508094645081, + "eval_steps": 20, + "global_step": 380, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.774840306202214e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3800/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3800/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3800/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3800/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3800/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3800/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3800/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3800/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3800/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3800/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3800/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3800/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3800/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3800/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..34d7b190d19766098a508daac13fe226fd05bfce --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3800/trainer_state.json @@ -0,0 +1,4024 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 9.453300124533001, + "eval_steps": 20, + "global_step": 3800, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + }, + { + "entropy": 0.561330484598875, + "epoch": 1.891656288916563, + "grad_norm": 0.6722865700721741, + "learning_rate": 0.0002208867897174789, + "loss": 0.499837589263916, + "mean_token_accuracy": 0.8518734864890576, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.5865232653396074, + "eval_loss": 0.5437926650047302, + "eval_mean_token_accuracy": 0.8450997017843779, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4116, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.547389242425561, + "epoch": 1.9414694894146949, + "grad_norm": 0.7935577034950256, + "learning_rate": 0.00022027119820226907, + "loss": 0.4977591514587402, + "mean_token_accuracy": 0.8539491161704064, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.5290903090391048, + "eval_loss": 0.5409526824951172, + "eval_mean_token_accuracy": 0.8497545698354411, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.7262, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 780 + }, + { + "entropy": 0.5687909748405218, + "epoch": 1.9912826899128269, + "grad_norm": 0.6180546283721924, + "learning_rate": 0.00021962329729698345, + "loss": 0.5109643459320068, + "mean_token_accuracy": 0.8521598495543004, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.5503541858390321, + "eval_loss": 0.5361555218696594, + "eval_mean_token_accuracy": 0.8510884285666221, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.3339, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 800 + }, + { + "entropy": 0.4739728841261986, + "epoch": 2.0398505603985058, + "grad_norm": 0.8058829307556152, + "learning_rate": 0.0002189432823996982, + "loss": 0.4204097747802734, + "mean_token_accuracy": 0.8728981889211215, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.5077334992414297, + "eval_loss": 0.5531114339828491, + "eval_mean_token_accuracy": 0.8489257208136625, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.4801, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.989, + "step": 820 + }, + { + "entropy": 0.4594309840351343, + "epoch": 2.0896637608966375, + "grad_norm": 0.6906896829605103, + "learning_rate": 0.0002182313585936314, + "loss": 0.4071959495544434, + "mean_token_accuracy": 0.8732857562601566, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.49850136994622474, + "eval_loss": 0.5486204624176025, + "eval_mean_token_accuracy": 0.8507991450470548, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.3364, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.4881629109382629, + "epoch": 2.1394769613947697, + "grad_norm": 0.6343470215797424, + "learning_rate": 0.0002174877405852928, + "loss": 0.41669540405273436, + "mean_token_accuracy": 0.8711295068264008, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.49155513924914734, + "eval_loss": 0.555109441280365, + "eval_mean_token_accuracy": 0.8496399400539176, + "eval_num_tokens": 2008562.0, + "eval_runtime": 86.3295, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 860 + }, + { + "entropy": 0.4648668970912695, + "epoch": 2.1892901618929015, + "grad_norm": 0.8014165163040161, + "learning_rate": 0.00021671265263973133, + "loss": 0.4110250473022461, + "mean_token_accuracy": 0.8754166305065155, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.4909258722219356, + "eval_loss": 0.5539511442184448, + "eval_mean_token_accuracy": 0.8492401502160138, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.3468, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 880 + }, + { + "entropy": 0.4824485514312983, + "epoch": 2.2391033623910337, + "grad_norm": 0.6665191054344177, + "learning_rate": 0.00021590632851289967, + "loss": 0.4181404113769531, + "mean_token_accuracy": 0.8726993151009083, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.4986876940657926, + "eval_loss": 0.547695517539978, + "eval_mean_token_accuracy": 0.8501384708770486, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.3838, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 900 + }, + { + "entropy": 0.4751896943897009, + "epoch": 2.2889165628891655, + "grad_norm": 0.81158047914505, + "learning_rate": 0.00021506901138115678, + "loss": 0.40689678192138673, + "mean_token_accuracy": 0.8745221219956875, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.507153491121392, + "eval_loss": 0.5501641631126404, + "eval_mean_token_accuracy": 0.8495670116918032, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.0912, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 920 + }, + { + "entropy": 0.4873133715242147, + "epoch": 2.3387297633872977, + "grad_norm": 0.7218056321144104, + "learning_rate": 0.0002142009537679292, + "loss": 0.42701358795166017, + "mean_token_accuracy": 0.8695114746689796, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5202612736543943, + "eval_loss": 0.5491839051246643, + "eval_mean_token_accuracy": 0.8494071208460386, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.1142, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 940 + }, + { + "entropy": 0.4762951169162989, + "epoch": 2.3885429638854294, + "grad_norm": 0.7194424867630005, + "learning_rate": 0.0002133024174675534, + "loss": 0.42299847602844237, + "mean_token_accuracy": 0.8709790132939815, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4899340462546016, + "eval_loss": 0.5522511601448059, + "eval_mean_token_accuracy": 0.8492208258357159, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.463, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 960 + }, + { + "entropy": 0.49650347977876663, + "epoch": 2.4383561643835616, + "grad_norm": 0.8406022787094116, + "learning_rate": 0.0002123736734663221, + "loss": 0.4275330066680908, + "mean_token_accuracy": 0.8670595556497573, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.49691385654515996, + "eval_loss": 0.5491269826889038, + "eval_mean_token_accuracy": 0.850309816210769, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.17, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 980 + }, + { + "entropy": 0.48843890577554705, + "epoch": 2.488169364881694, + "grad_norm": 0.9082473516464233, + "learning_rate": 0.00021141500186075868, + "loss": 0.4309722423553467, + "mean_token_accuracy": 0.8686766296625137, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5543508351195691, + "eval_loss": 0.5478800535202026, + "eval_mean_token_accuracy": 0.8478029522784921, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.3835, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 1000 + }, + { + "entropy": 0.4777219031006098, + "epoch": 2.5379825653798256, + "grad_norm": 0.7448089122772217, + "learning_rate": 0.0002104266917731438, + "loss": 0.423325252532959, + "mean_token_accuracy": 0.8706337086856365, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.49857561550168106, + "eval_loss": 0.5511948466300964, + "eval_mean_token_accuracy": 0.8502220289651737, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.5399, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.988, + "step": 1020 + }, + { + "entropy": 0.4844174191355705, + "epoch": 2.587795765877958, + "grad_norm": 0.794029176235199, + "learning_rate": 0.00020940904126432, + "loss": 0.4176753044128418, + "mean_token_accuracy": 0.873535567522049, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.485467542222766, + "eval_loss": 0.5539286732673645, + "eval_mean_token_accuracy": 0.8495475081510322, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.135, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 1.997, + "step": 1040 + }, + { + "entropy": 0.49070929251611234, + "epoch": 2.6376089663760895, + "grad_norm": 0.7558256983757019, + "learning_rate": 0.0002083623572438007, + "loss": 0.42867293357849123, + "mean_token_accuracy": 0.8696666076779366, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.490822730889154, + "eval_loss": 0.5434785485267639, + "eval_mean_token_accuracy": 0.850568296950917, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.4933, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 1060 + }, + { + "entropy": 0.47806114703416824, + "epoch": 2.6874221668742218, + "grad_norm": 0.6608979105949402, + "learning_rate": 0.00020728695537721047, + "loss": 0.4289727687835693, + "mean_token_accuracy": 0.8693130135536193, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.5285773256490397, + "eval_loss": 0.5444230437278748, + "eval_mean_token_accuracy": 0.8498796481032704, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.7091, + "eval_samples_per_second": 15.858, + "eval_steps_per_second": 1.984, + "step": 1080 + }, + { + "entropy": 0.5046216730028391, + "epoch": 2.7372353673723535, + "grad_norm": 0.8428544998168945, + "learning_rate": 0.00020618315999108454, + "loss": 0.43131070137023925, + "mean_token_accuracy": 0.8701941035687923, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.49888394738352576, + "eval_loss": 0.5459766387939453, + "eval_mean_token_accuracy": 0.8511758872935938, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.2222, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.995, + "step": 1100 + }, + { + "entropy": 0.5212558470666409, + "epoch": 2.7870485678704857, + "grad_norm": 1.129318118095398, + "learning_rate": 0.00020505130397505635, + "loss": 0.44249300956726073, + "mean_token_accuracy": 0.8654101334512234, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5179622324053631, + "eval_loss": 0.5522801280021667, + "eval_mean_token_accuracy": 0.8497019947268242, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.1903, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.996, + "step": 1120 + }, + { + "entropy": 0.4988406613469124, + "epoch": 2.8368617683686175, + "grad_norm": 0.6460545063018799, + "learning_rate": 0.00020389172868146263, + "loss": 0.4386270523071289, + "mean_token_accuracy": 0.8690383620560169, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.5042278484203094, + "eval_loss": 0.5433034300804138, + "eval_mean_token_accuracy": 0.8497674451317898, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.3028, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.993, + "step": 1140 + }, + { + "entropy": 0.4926559619605541, + "epoch": 2.8866749688667497, + "grad_norm": 0.8199329972267151, + "learning_rate": 0.00020270478382239615, + "loss": 0.4313485145568848, + "mean_token_accuracy": 0.8674727231264114, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.503873193160046, + "eval_loss": 0.5388111472129822, + "eval_mean_token_accuracy": 0.8526195034731266, + "eval_num_tokens": 2710196.0, + "eval_runtime": 86.4054, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.991, + "step": 1160 + }, + { + "entropy": 0.5020013231784105, + "epoch": 2.936488169364882, + "grad_norm": 0.7344821095466614, + "learning_rate": 0.00020149082736423723, + "loss": 0.43590536117553713, + "mean_token_accuracy": 0.8671772189438343, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5368241809828337, + "eval_loss": 0.5355703830718994, + "eval_mean_token_accuracy": 0.8517617773871089, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.2945, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1180 + }, + { + "entropy": 0.5112275708466768, + "epoch": 2.9863013698630136, + "grad_norm": 0.6951606869697571, + "learning_rate": 0.00020025022541969622, + "loss": 0.43579301834106443, + "mean_token_accuracy": 0.8641206480562686, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.5066795706055885, + "eval_loss": 0.5415249466896057, + "eval_mean_token_accuracy": 0.8493563373421513, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.5005, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.988, + "step": 1200 + }, + { + "entropy": 0.42298635305502474, + "epoch": 3.0348692403486925, + "grad_norm": 0.8201794028282166, + "learning_rate": 0.00019898335213739863, + "loss": 0.35593905448913576, + "mean_token_accuracy": 0.889238600547497, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.4584170470750609, + "eval_loss": 0.569487452507019, + "eval_mean_token_accuracy": 0.8495814173027526, + "eval_num_tokens": 2848509.0, + "eval_runtime": 86.2281, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 1220 + }, + { + "entropy": 0.37450140453875064, + "epoch": 3.0846824408468243, + "grad_norm": 0.7308394908905029, + "learning_rate": 0.0001976905895890471, + "loss": 0.307823920249939, + "mean_token_accuracy": 0.9001288741827012, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.45185995916294497, + "eval_loss": 0.5672881603240967, + "eval_mean_token_accuracy": 0.8511318519364955, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.0819, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.998, + "step": 1240 + }, + { + "entropy": 0.3887945845723152, + "epoch": 3.1344956413449565, + "grad_norm": 0.7299330830574036, + "learning_rate": 0.0001963723276541939, + "loss": 0.32047903537750244, + "mean_token_accuracy": 0.8960984498262405, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.44865354549053105, + "eval_loss": 0.5666037201881409, + "eval_mean_token_accuracy": 0.8496572649063066, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 1260 + }, + { + "entropy": 0.39677664265036583, + "epoch": 3.1843088418430883, + "grad_norm": 0.9533219933509827, + "learning_rate": 0.00019502896390265838, + "loss": 0.3253983497619629, + "mean_token_accuracy": 0.8964207418262958, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.4641980809527774, + "eval_loss": 0.5814996957778931, + "eval_mean_token_accuracy": 0.8485886212005171, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.7784, + "eval_samples_per_second": 15.845, + "eval_steps_per_second": 1.982, + "step": 1280 + }, + { + "entropy": 0.39210722744464876, + "epoch": 3.2341220423412205, + "grad_norm": 0.7447651028633118, + "learning_rate": 0.00019366090347462545, + "loss": 0.3276803970336914, + "mean_token_accuracy": 0.8930055953562259, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43595615254585135, + "eval_loss": 0.5722188353538513, + "eval_mean_token_accuracy": 0.8501105755567551, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.5271, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 1300 + }, + { + "entropy": 0.3684127271175385, + "epoch": 3.2839352428393527, + "grad_norm": 0.6934201121330261, + "learning_rate": 0.00019226855895846078, + "loss": 0.3156379222869873, + "mean_token_accuracy": 0.8976306475698947, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.4628148723480313, + "eval_loss": 0.5631352066993713, + "eval_mean_token_accuracy": 0.8504934813394103, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.3436, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 1320 + }, + { + "entropy": 0.4073401909321547, + "epoch": 3.3337484433374844, + "grad_norm": 0.9386897683143616, + "learning_rate": 0.00019085235026627994, + "loss": 0.34265310764312745, + "mean_token_accuracy": 0.8902062118053437, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.46455050623694133, + "eval_loss": 0.5586736798286438, + "eval_mean_token_accuracy": 0.8506874702004499, + "eval_num_tokens": 3132874.0, + "eval_runtime": 86.1286, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.997, + "step": 1340 + }, + { + "entropy": 0.4046429242938757, + "epoch": 3.383561643835616, + "grad_norm": 0.9633992314338684, + "learning_rate": 0.00018941270450730836, + "loss": 0.33816893100738527, + "mean_token_accuracy": 0.8927541889250279, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.46846531660750856, + "eval_loss": 0.561501681804657, + "eval_mean_token_accuracy": 0.8496256377114806, + "eval_num_tokens": 3178055.0, + "eval_runtime": 86.685, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1360 + }, + { + "entropy": 0.39872407019138334, + "epoch": 3.4333748443337484, + "grad_norm": 0.7786458730697632, + "learning_rate": 0.00018795005585907113, + "loss": 0.33342490196228025, + "mean_token_accuracy": 0.8944805048406124, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.42709505973860273, + "eval_loss": 0.5751848220825195, + "eval_mean_token_accuracy": 0.8507290447867194, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.6892, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 1380 + }, + { + "entropy": 0.3923338124528527, + "epoch": 3.4831880448318806, + "grad_norm": 0.9305956363677979, + "learning_rate": 0.0001864648454364511, + "loss": 0.33188116550445557, + "mean_token_accuracy": 0.8943330392241478, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.4386174779298694, + "eval_loss": 0.5680831074714661, + "eval_mean_token_accuracy": 0.8513129727784977, + "eval_num_tokens": 3274096.0, + "eval_runtime": 86.2671, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 1400 + }, + { + "entropy": 0.3856233984231949, + "epoch": 3.5330012453300124, + "grad_norm": 1.0362752676010132, + "learning_rate": 0.0001849575211586545, + "loss": 0.33098697662353516, + "mean_token_accuracy": 0.8961390435695649, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4574795474493226, + "eval_loss": 0.5630439519882202, + "eval_mean_token_accuracy": 0.8520988873964133, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.6035, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 1420 + }, + { + "entropy": 0.39812871962785723, + "epoch": 3.5828144458281446, + "grad_norm": 0.7807195782661438, + "learning_rate": 0.0001834285376141247, + "loss": 0.3333771228790283, + "mean_token_accuracy": 0.8930827379226685, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.4556825893909432, + "eval_loss": 0.5689062476158142, + "eval_mean_token_accuracy": 0.8507103507601937, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.1606, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.996, + "step": 1440 + }, + { + "entropy": 0.4147744856774807, + "epoch": 3.6326276463262763, + "grad_norm": 0.6429352164268494, + "learning_rate": 0.00018187835592344443, + "loss": 0.3482560873031616, + "mean_token_accuracy": 0.8910200245678425, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.46600024540757023, + "eval_loss": 0.5609709024429321, + "eval_mean_token_accuracy": 0.8491220876227977, + "eval_num_tokens": 3415600.0, + "eval_runtime": 86.8039, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1460 + }, + { + "entropy": 0.40425071083009245, + "epoch": 3.6824408468244085, + "grad_norm": 0.8613698482513428, + "learning_rate": 0.0001803074436002682, + "loss": 0.342916464805603, + "mean_token_accuracy": 0.8916418336331844, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.43855057899342026, + "eval_loss": 0.5720968246459961, + "eval_mean_token_accuracy": 0.8500823641932288, + "eval_num_tokens": 3460471.0, + "eval_runtime": 86.6746, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1480 + }, + { + "entropy": 0.39465143866837027, + "epoch": 3.7322540473225407, + "grad_norm": 0.6285189986228943, + "learning_rate": 0.0001787162744103265, + "loss": 0.3424591779708862, + "mean_token_accuracy": 0.8906558901071548, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4509461877304454, + "eval_loss": 0.5590082406997681, + "eval_mean_token_accuracy": 0.8511747371318729, + "eval_num_tokens": 3507647.0, + "eval_runtime": 86.8126, + "eval_samples_per_second": 15.839, + "eval_steps_per_second": 1.981, + "step": 1500 + }, + { + "entropy": 0.4021005939692259, + "epoch": 3.7820672478206725, + "grad_norm": 0.8821248412132263, + "learning_rate": 0.00017710532822854468, + "loss": 0.3462103843688965, + "mean_token_accuracy": 0.889109355956316, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.4502199075596277, + "eval_loss": 0.566046416759491, + "eval_mean_token_accuracy": 0.8501714208098345, + "eval_num_tokens": 3548934.0, + "eval_runtime": 86.8336, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.981, + "step": 1520 + }, + { + "entropy": 0.4017397932708263, + "epoch": 3.8318804483188043, + "grad_norm": 0.8400952816009521, + "learning_rate": 0.0001754750908943189, + "loss": 0.34890995025634763, + "mean_token_accuracy": 0.8892098367214203, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.4614003023435903, + "eval_loss": 0.5617933869361877, + "eval_mean_token_accuracy": 0.8515863616106122, + "eval_num_tokens": 3597186.0, + "eval_runtime": 86.4609, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 1540 + }, + { + "entropy": 0.4112051840871572, + "epoch": 3.8816936488169365, + "grad_norm": 0.769478440284729, + "learning_rate": 0.0001738260540649939, + "loss": 0.34711437225341796, + "mean_token_accuracy": 0.8911717928946018, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4540443811998811, + "eval_loss": 0.5576469898223877, + "eval_mean_token_accuracy": 0.8512079674144124, + "eval_num_tokens": 3646646.0, + "eval_runtime": 86.5103, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 1560 + }, + { + "entropy": 0.41105241514742374, + "epoch": 3.9315068493150687, + "grad_norm": 0.8468427062034607, + "learning_rate": 0.00017215871506758568, + "loss": 0.3433023452758789, + "mean_token_accuracy": 0.8898739732801915, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.4707539707075718, + "eval_loss": 0.5641466379165649, + "eval_mean_token_accuracy": 0.8495440957851188, + "eval_num_tokens": 3689560.0, + "eval_runtime": 86.609, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.986, + "step": 1580 + }, + { + "entropy": 0.41016379147768023, + "epoch": 3.9813200498132004, + "grad_norm": 0.7482675313949585, + "learning_rate": 0.0001704735767487946, + "loss": 0.34550890922546384, + "mean_token_accuracy": 0.8893028847873211, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.46391099864660307, + "eval_loss": 0.5593640804290771, + "eval_mean_token_accuracy": 0.8510130581467651, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.3975, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 1600 + }, + { + "entropy": 0.33167599791135544, + "epoch": 4.029887920298879, + "grad_norm": 0.9435692429542542, + "learning_rate": 0.00016877114732335337, + "loss": 0.2716026544570923, + "mean_token_accuracy": 0.9133149828666296, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.38499350005457567, + "eval_loss": 0.6298249363899231, + "eval_mean_token_accuracy": 0.8488117071778275, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.2933, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1620 + }, + { + "entropy": 0.3000166634097695, + "epoch": 4.0797011207970115, + "grad_norm": 0.8080845475196838, + "learning_rate": 0.0001670519402207569, + "loss": 0.22617182731628419, + "mean_token_accuracy": 0.9253474645316601, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.370110988703578, + "eval_loss": 0.6338461637496948, + "eval_mean_token_accuracy": 0.8485634801692741, + "eval_num_tokens": 3828830.0, + "eval_runtime": 85.9508, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.001, + "step": 1640 + }, + { + "entropy": 0.2986910421401262, + "epoch": 4.129514321295143, + "grad_norm": 0.7310900092124939, + "learning_rate": 0.0001653164739304185, + "loss": 0.22367463111877442, + "mean_token_accuracy": 0.9252275295555592, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.3944379702037157, + "eval_loss": 0.6109381914138794, + "eval_mean_token_accuracy": 0.849291454220927, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.6728, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1660 + }, + { + "entropy": 0.3095553796738386, + "epoch": 4.179327521793275, + "grad_norm": 0.7059140801429749, + "learning_rate": 0.0001635652718453007, + "loss": 0.23651680946350098, + "mean_token_accuracy": 0.9208931416273117, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.3910588648949945, + "eval_loss": 0.6104469299316406, + "eval_mean_token_accuracy": 0.8486883893262508, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7612, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.982, + "step": 1680 + }, + { + "entropy": 0.3001101028174162, + "epoch": 4.229140722291407, + "grad_norm": 0.6787802577018738, + "learning_rate": 0.00016179886210406728, + "loss": 0.23130471706390382, + "mean_token_accuracy": 0.9233332790434361, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3794369170832079, + "eval_loss": 0.6182110905647278, + "eval_mean_token_accuracy": 0.8495433777570724, + "eval_num_tokens": 3967474.0, + "eval_runtime": 85.94, + "eval_samples_per_second": 16.0, + "eval_steps_per_second": 2.001, + "step": 1700 + }, + { + "entropy": 0.3031421799212694, + "epoch": 4.2789539227895395, + "grad_norm": 0.9732038378715515, + "learning_rate": 0.0001600177774318036, + "loss": 0.2359529733657837, + "mean_token_accuracy": 0.9217648565769195, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3923123094231583, + "eval_loss": 0.6057384610176086, + "eval_mean_token_accuracy": 0.8508818288182103, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7647, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.29365369994193313, + "epoch": 4.328767123287671, + "grad_norm": 0.7681498527526855, + "learning_rate": 0.0001582225549793541, + "loss": 0.2269371747970581, + "mean_token_accuracy": 0.9245341829955578, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.4011661055129628, + "eval_loss": 0.6144486665725708, + "eval_mean_token_accuracy": 0.8480324357054955, + "eval_num_tokens": 4062594.0, + "eval_runtime": 87.1306, + "eval_samples_per_second": 15.781, + "eval_steps_per_second": 1.974, + "step": 1740 + }, + { + "entropy": 0.29396994728595016, + "epoch": 4.378580323785803, + "grad_norm": 1.0001007318496704, + "learning_rate": 0.0001564137361613248, + "loss": 0.22777395248413085, + "mean_token_accuracy": 0.9262309700250626, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38518730195802314, + "eval_loss": 0.6202630400657654, + "eval_mean_token_accuracy": 0.8493869807137999, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6616, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.3096018506214023, + "epoch": 4.428393524283935, + "grad_norm": 1.0448365211486816, + "learning_rate": 0.00015459186649280024, + "loss": 0.23696351051330566, + "mean_token_accuracy": 0.9217322513461113, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.3946371126140273, + "eval_loss": 0.6079026460647583, + "eval_mean_token_accuracy": 0.8492515852978063, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6582, + "eval_samples_per_second": 15.867, + "eval_steps_per_second": 1.985, + "step": 1780 + }, + { + "entropy": 0.32619857545942066, + "epoch": 4.478206724782067, + "grad_norm": 0.7210651636123657, + "learning_rate": 0.00015275749542482337, + "loss": 0.24651215076446534, + "mean_token_accuracy": 0.9177676141262054, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.3947690814560236, + "eval_loss": 0.6065912246704102, + "eval_mean_token_accuracy": 0.8502957744653835, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.5959, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.986, + "step": 1800 + }, + { + "entropy": 0.3193941755220294, + "epoch": 4.5280199252802, + "grad_norm": 0.8281906843185425, + "learning_rate": 0.0001509111761786888, + "loss": 0.23936262130737304, + "mean_token_accuracy": 0.9201708927750587, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38704028864239537, + "eval_loss": 0.6006569266319275, + "eval_mean_token_accuracy": 0.8502406720505205, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.8059, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1820 + }, + { + "entropy": 0.3164879363030195, + "epoch": 4.577833125778331, + "grad_norm": 0.7892968654632568, + "learning_rate": 0.00014905346557909867, + "loss": 0.24541733264923096, + "mean_token_accuracy": 0.9175932116806507, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.38861122120951497, + "eval_loss": 0.6115967631340027, + "eval_mean_token_accuracy": 0.849471275196519, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.2946, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1840 + }, + { + "entropy": 0.3051785985007882, + "epoch": 4.627646326276463, + "grad_norm": 0.8109654188156128, + "learning_rate": 0.0001471849238862319, + "loss": 0.23433220386505127, + "mean_token_accuracy": 0.9206570319831371, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.37162452295076015, + "eval_loss": 0.6184061765670776, + "eval_mean_token_accuracy": 0.8501173268223918, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.6865, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1860 + }, + { + "entropy": 0.3168198253959417, + "epoch": 4.677459526774595, + "grad_norm": 0.9512342214584351, + "learning_rate": 0.0001453061146267775, + "loss": 0.23832404613494873, + "mean_token_accuracy": 0.9197044663131237, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3845940856912801, + "eval_loss": 0.606762707233429, + "eval_mean_token_accuracy": 0.8504838194957999, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.5175, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 1880 + }, + { + "entropy": 0.30791807882487776, + "epoch": 4.7272727272727275, + "grad_norm": 0.8123113512992859, + "learning_rate": 0.00014341760442398248, + "loss": 0.2395785331726074, + "mean_token_accuracy": 0.918928150832653, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.39762327222283494, + "eval_loss": 0.5994202494621277, + "eval_mean_token_accuracy": 0.8509274201337681, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.2873, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.993, + "step": 1900 + }, + { + "entropy": 0.3021434534341097, + "epoch": 4.777085927770859, + "grad_norm": 0.731787383556366, + "learning_rate": 0.000141519962826766, + "loss": 0.23494718074798585, + "mean_token_accuracy": 0.9201403826475143, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.3827026732439219, + "eval_loss": 0.5995895862579346, + "eval_mean_token_accuracy": 0.851468373523202, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.3006, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 1920 + }, + { + "entropy": 0.31626159623265265, + "epoch": 4.826899128268991, + "grad_norm": 0.8848487138748169, + "learning_rate": 0.00013961376213795132, + "loss": 0.2439030647277832, + "mean_token_accuracy": 0.9196575872600079, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.388698436839636, + "eval_loss": 0.6000174283981323, + "eval_mean_token_accuracy": 0.8518068187458571, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.8979, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.979, + "step": 1940 + }, + { + "entropy": 0.30520407035946845, + "epoch": 4.876712328767123, + "grad_norm": 0.8532460927963257, + "learning_rate": 0.00013769957724166695, + "loss": 0.23458616733551024, + "mean_token_accuracy": 0.9221912942826748, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.38777847102908203, + "eval_loss": 0.6004981398582458, + "eval_mean_token_accuracy": 0.8516481768253238, + "eval_num_tokens": 4578167.0, + "eval_runtime": 87.0777, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.975, + "step": 1960 + }, + { + "entropy": 0.3226448342204094, + "epoch": 4.926525529265255, + "grad_norm": 0.6945561766624451, + "learning_rate": 0.0001357779854299694, + "loss": 0.24048397541046143, + "mean_token_accuracy": 0.9195300146937371, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.38581624263247777, + "eval_loss": 0.6029234528541565, + "eval_mean_token_accuracy": 0.8514213260523108, + "eval_num_tokens": 4622316.0, + "eval_runtime": 85.8729, + "eval_samples_per_second": 16.012, + "eval_steps_per_second": 2.003, + "step": 1980 + }, + { + "entropy": 0.3051655298098922, + "epoch": 4.976338729763388, + "grad_norm": 0.7976452708244324, + "learning_rate": 0.00013384956622874001, + "loss": 0.23584742546081544, + "mean_token_accuracy": 0.9216851457953453, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.37913159246361533, + "eval_loss": 0.6057604551315308, + "eval_mean_token_accuracy": 0.8525801203971686, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.1145, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 2000 + }, + { + "entropy": 0.27438195240803254, + "epoch": 5.024906600249066, + "grad_norm": 0.6729586124420166, + "learning_rate": 0.0001319149012229075, + "loss": 0.19775952100753785, + "mean_token_accuracy": 0.9339428559327737, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.3448961910813354, + "eval_loss": 0.6750120520591736, + "eval_mean_token_accuracy": 0.8487970232963562, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.1169, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 2020 + }, + { + "entropy": 0.21423916313797237, + "epoch": 5.074719800747198, + "grad_norm": 0.6934391856193542, + "learning_rate": 0.00012997457388105022, + "loss": 0.1439570426940918, + "mean_token_accuracy": 0.9528236843645572, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.3570949243771475, + "eval_loss": 0.6465504169464111, + "eval_mean_token_accuracy": 0.8490785547467166, + "eval_num_tokens": 4763269.0, + "eval_runtime": 85.9574, + "eval_samples_per_second": 15.996, + "eval_steps_per_second": 2.001, + "step": 2040 + }, + { + "entropy": 0.20838565267622472, + "epoch": 5.12453300124533, + "grad_norm": 0.7286986112594604, + "learning_rate": 0.00012802916937942972, + "loss": 0.14467307329177856, + "mean_token_accuracy": 0.950994835793972, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.3452463157821533, + "eval_loss": 0.6705958843231201, + "eval_mean_token_accuracy": 0.8490352796953778, + "eval_num_tokens": 4809047.0, + "eval_runtime": 86.228, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 2060 + }, + { + "entropy": 0.20453082229942082, + "epoch": 5.174346201743462, + "grad_norm": 0.7515555620193481, + "learning_rate": 0.00012607927442550974, + "loss": 0.13732000589370727, + "mean_token_accuracy": 0.9537357829511166, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.32431264914745506, + "eval_loss": 0.6743043065071106, + "eval_mean_token_accuracy": 0.8504878629085629, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.5948, + "eval_samples_per_second": 15.879, + "eval_steps_per_second": 1.986, + "step": 2080 + }, + { + "entropy": 0.21812320686876774, + "epoch": 5.224159402241594, + "grad_norm": 0.9093465209007263, + "learning_rate": 0.0001241254770810132, + "loss": 0.14311420917510986, + "mean_token_accuracy": 0.9514068141579628, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.33086285835435225, + "eval_loss": 0.6676449179649353, + "eval_mean_token_accuracy": 0.8505287662495015, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 2100 + }, + { + "entropy": 0.2180163251236081, + "epoch": 5.273972602739726, + "grad_norm": 0.6703007221221924, + "learning_rate": 0.00012216836658457075, + "loss": 0.14803968667984008, + "mean_token_accuracy": 0.9521303348243236, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.33162341708707255, + "eval_loss": 0.6658875942230225, + "eval_mean_token_accuracy": 0.8500757605530495, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.6296, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 2120 + }, + { + "entropy": 0.22511130161583423, + "epoch": 5.323785803237858, + "grad_norm": 0.8078880906105042, + "learning_rate": 0.00012020853317401455, + "loss": 0.15228408575057983, + "mean_token_accuracy": 0.947144789993763, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3354601170434508, + "eval_loss": 0.6677829623222351, + "eval_mean_token_accuracy": 0.8482600024273229, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.4689, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.989, + "step": 2140 + }, + { + "entropy": 0.2244176059961319, + "epoch": 5.37359900373599, + "grad_norm": 0.9636075496673584, + "learning_rate": 0.00011824656790837037, + "loss": 0.15260883569717407, + "mean_token_accuracy": 0.9471467643976211, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.3381616926297199, + "eval_loss": 0.6694412231445312, + "eval_mean_token_accuracy": 0.8482369603805764, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.4147, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 2160 + }, + { + "entropy": 0.22982364390045404, + "epoch": 5.423412204234122, + "grad_norm": 0.775401771068573, + "learning_rate": 0.00011628306248960262, + "loss": 0.15140302181243898, + "mean_token_accuracy": 0.9492553934454918, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.3305150235808173, + "eval_loss": 0.6717822551727295, + "eval_mean_token_accuracy": 0.8489849723355715, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.4728, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.989, + "step": 2180 + }, + { + "entropy": 0.21448935717344284, + "epoch": 5.473225404732254, + "grad_norm": 0.6575281023979187, + "learning_rate": 0.00011431860908416465, + "loss": 0.1452319622039795, + "mean_token_accuracy": 0.9505287684500218, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3488145174328671, + "eval_loss": 0.6612305641174316, + "eval_mean_token_accuracy": 0.8492907808963642, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6927, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 2200 + }, + { + "entropy": 0.23091202937066554, + "epoch": 5.523038605230386, + "grad_norm": 0.8909686207771301, + "learning_rate": 0.00011235380014440985, + "loss": 0.15150139331817628, + "mean_token_accuracy": 0.9497875183820724, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.3268539015810157, + "eval_loss": 0.6667542457580566, + "eval_mean_token_accuracy": 0.8499062903398691, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.4644, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 2220 + }, + { + "entropy": 0.2227974807843566, + "epoch": 5.572851805728518, + "grad_norm": 0.6180275082588196, + "learning_rate": 0.0001103892282299158, + "loss": 0.1491069197654724, + "mean_token_accuracy": 0.9488144010305405, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3346347655494546, + "eval_loss": 0.6665948629379272, + "eval_mean_token_accuracy": 0.8499961893918903, + "eval_num_tokens": 5226864.0, + "eval_runtime": 87.0548, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.976, + "step": 2240 + }, + { + "entropy": 0.21368421968072654, + "epoch": 5.62266500622665, + "grad_norm": 0.6004369258880615, + "learning_rate": 0.00010842548582877651, + "loss": 0.14485255479812623, + "mean_token_accuracy": 0.9502056457102299, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.32753298804163933, + "eval_loss": 0.6680151224136353, + "eval_mean_token_accuracy": 0.8515451086121936, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.8524, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.98, + "step": 2260 + }, + { + "entropy": 0.2103635374456644, + "epoch": 5.672478206724782, + "grad_norm": 0.699174702167511, + "learning_rate": 0.00010646316517891613, + "loss": 0.14297772645950318, + "mean_token_accuracy": 0.9512537539005279, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.32966585959806, + "eval_loss": 0.675578773021698, + "eval_mean_token_accuracy": 0.8509623023659684, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.4518, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.99, + "step": 2280 + }, + { + "entropy": 0.22516900151968003, + "epoch": 5.722291407222914, + "grad_norm": 0.6637354493141174, + "learning_rate": 0.00010450285808947797, + "loss": 0.15202572345733642, + "mean_token_accuracy": 0.9482452072203159, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3369456917740578, + "eval_loss": 0.6697061061859131, + "eval_mean_token_accuracy": 0.848603522361711, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.6371, + "eval_samples_per_second": 15.871, + "eval_steps_per_second": 1.985, + "step": 2300 + }, + { + "entropy": 0.21841065725311637, + "epoch": 5.772104607721046, + "grad_norm": 0.7940268516540527, + "learning_rate": 0.00010254515576234297, + "loss": 0.14710167646408082, + "mean_token_accuracy": 0.9493498183786869, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3237486180177955, + "eval_loss": 0.6779657602310181, + "eval_mean_token_accuracy": 0.8500715313955794, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.1826, + "eval_samples_per_second": 15.954, + "eval_steps_per_second": 1.996, + "step": 2320 + }, + { + "entropy": 0.22146204356104135, + "epoch": 5.821917808219178, + "grad_norm": 0.9234833121299744, + "learning_rate": 0.00010059064861383132, + "loss": 0.14720046520233154, + "mean_token_accuracy": 0.9493872679769992, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.32365207564692167, + "eval_loss": 0.6704005002975464, + "eval_mean_token_accuracy": 0.8507985760306203, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.5494, + "eval_samples_per_second": 15.887, + "eval_steps_per_second": 1.987, + "step": 2340 + }, + { + "entropy": 0.20934011954814197, + "epoch": 5.87173100871731, + "grad_norm": 0.5547503232955933, + "learning_rate": 9.863992609664084e-05, + "loss": 0.1464867353439331, + "mean_token_accuracy": 0.9503875687718392, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.3330401429083458, + "eval_loss": 0.6659091114997864, + "eval_mean_token_accuracy": 0.8504848906467127, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.5855, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 2360 + }, + { + "entropy": 0.21678635366261007, + "epoch": 5.921544209215442, + "grad_norm": 0.570612907409668, + "learning_rate": 9.669357652207635e-05, + "loss": 0.14821385145187377, + "mean_token_accuracy": 0.9503940217196941, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3322022325077722, + "eval_loss": 0.6722489595413208, + "eval_mean_token_accuracy": 0.8489979422369669, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.2986, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 2380 + }, + { + "entropy": 0.20932920072227718, + "epoch": 5.971357409713574, + "grad_norm": 0.7879557609558105, + "learning_rate": 9.475218688262262e-05, + "loss": 0.14675841331481934, + "mean_token_accuracy": 0.9507176131010056, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.3199348642902319, + "eval_loss": 0.6698136329650879, + "eval_mean_token_accuracy": 0.8514142130003419, + "eval_num_tokens": 5605400.0, + "eval_runtime": 85.8995, + "eval_samples_per_second": 16.007, + "eval_steps_per_second": 2.002, + "step": 2400 + }, + { + "entropy": 0.21032143919131693, + "epoch": 6.019925280199253, + "grad_norm": 0.5823076367378235, + "learning_rate": 9.281634267491569e-05, + "loss": 0.13322267532348633, + "mean_token_accuracy": 0.9550939072401096, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.30206270117399303, + "eval_loss": 0.7093168497085571, + "eval_mean_token_accuracy": 0.8500627639681794, + "eval_num_tokens": 5648968.0, + "eval_runtime": 85.8128, + "eval_samples_per_second": 16.023, + "eval_steps_per_second": 2.004, + "step": 2420 + }, + { + "entropy": 0.1534628233872354, + "epoch": 6.069738480697385, + "grad_norm": 0.710133969783783, + "learning_rate": 9.088662772316508e-05, + "loss": 0.09078952670097351, + "mean_token_accuracy": 0.9678447999060154, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.28208133101809857, + "eval_loss": 0.7636417150497437, + "eval_mean_token_accuracy": 0.8494061477655588, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9724, + "eval_samples_per_second": 15.994, + "eval_steps_per_second": 2.001, + "step": 2440 + }, + { + "entropy": 0.16151462448760867, + "epoch": 6.119551681195516, + "grad_norm": 0.5793812274932861, + "learning_rate": 8.896362400308028e-05, + "loss": 0.09545697569847107, + "mean_token_accuracy": 0.9671573750674725, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.2833245605403601, + "eval_loss": 0.7402405738830566, + "eval_mean_token_accuracy": 0.8503523728875226, + "eval_num_tokens": 5745090.0, + "eval_runtime": 85.5461, + "eval_samples_per_second": 16.073, + "eval_steps_per_second": 2.011, + "step": 2460 + }, + { + "entropy": 0.15203177919611335, + "epoch": 6.169364881693649, + "grad_norm": 0.4251123368740082, + "learning_rate": 8.704791146635483e-05, + "loss": 0.09420782327651978, + "mean_token_accuracy": 0.9677386932075024, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.28572545962971313, + "eval_loss": 0.735416829586029, + "eval_mean_token_accuracy": 0.8487084663884584, + "eval_num_tokens": 5790333.0, + "eval_runtime": 85.4801, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.012, + "step": 2480 + }, + { + "entropy": 0.15587336672469973, + "epoch": 6.219178082191781, + "grad_norm": 0.4357028007507324, + "learning_rate": 8.514006786576085e-05, + "loss": 0.09429320096969604, + "mean_token_accuracy": 0.9682952925562859, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.2859006894882335, + "eval_loss": 0.7347224950790405, + "eval_mean_token_accuracy": 0.8501905518215757, + "eval_num_tokens": 5837321.0, + "eval_runtime": 85.7578, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.006, + "step": 2500 + }, + { + "entropy": 0.15765639198943973, + "epoch": 6.268991282689913, + "grad_norm": 0.47331130504608154, + "learning_rate": 8.324066858090663e-05, + "loss": 0.09571113586425781, + "mean_token_accuracy": 0.9683481335639954, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.29231513846059176, + "eval_loss": 0.7392512559890747, + "eval_mean_token_accuracy": 0.8486633983462356, + "eval_num_tokens": 5884398.0, + "eval_runtime": 85.7846, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.005, + "step": 2520 + }, + { + "entropy": 0.16176860257983208, + "epoch": 6.318804483188045, + "grad_norm": 0.6142018437385559, + "learning_rate": 8.135028644470992e-05, + "loss": 0.09486144185066223, + "mean_token_accuracy": 0.9682316601276397, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.2851274753379267, + "eval_loss": 0.7520816922187805, + "eval_mean_token_accuracy": 0.8501113649717597, + "eval_num_tokens": 5929876.0, + "eval_runtime": 85.9425, + "eval_samples_per_second": 15.999, + "eval_steps_per_second": 2.001, + "step": 2540 + }, + { + "entropy": 0.15404034564271568, + "epoch": 6.3686176836861765, + "grad_norm": 0.6051287651062012, + "learning_rate": 7.946949157063964e-05, + "loss": 0.09280472993850708, + "mean_token_accuracy": 0.9684635892510414, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28802703563557114, + "eval_loss": 0.7439162135124207, + "eval_mean_token_accuracy": 0.8499851770872293, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.0703, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.998, + "step": 2560 + }, + { + "entropy": 0.15343588953837753, + "epoch": 6.418430884184309, + "grad_norm": 0.4823743402957916, + "learning_rate": 7.759885118077701e-05, + "loss": 0.09000591039657593, + "mean_token_accuracy": 0.9699928767979145, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2795634938533916, + "eval_loss": 0.7647850513458252, + "eval_mean_token_accuracy": 0.8503464397995971, + "eval_num_tokens": 6025380.0, + "eval_runtime": 85.8886, + "eval_samples_per_second": 16.009, + "eval_steps_per_second": 2.003, + "step": 2580 + }, + { + "entropy": 0.15740026142448188, + "epoch": 6.468244084682441, + "grad_norm": 0.5082696676254272, + "learning_rate": 7.57389294347494e-05, + "loss": 0.09191849827766418, + "mean_token_accuracy": 0.9692809768021107, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2913342311458532, + "eval_loss": 0.7518694996833801, + "eval_mean_token_accuracy": 0.8483168302580367, + "eval_num_tokens": 6073349.0, + "eval_runtime": 85.5761, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.01, + "step": 2600 + }, + { + "entropy": 0.15922069251537324, + "epoch": 6.518057285180573, + "grad_norm": 0.3995199501514435, + "learning_rate": 7.389028725958736e-05, + "loss": 0.09584367871284485, + "mean_token_accuracy": 0.9685114495456218, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.2863075934177221, + "eval_loss": 0.7539381384849548, + "eval_mean_token_accuracy": 0.8507507083027862, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.112, + "eval_samples_per_second": 15.968, + "eval_steps_per_second": 1.997, + "step": 2620 + }, + { + "entropy": 0.16197575423866512, + "epoch": 6.567870485678705, + "grad_norm": 0.534295380115509, + "learning_rate": 7.205348218055678e-05, + "loss": 0.0961170256137848, + "mean_token_accuracy": 0.9674530044198036, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.29021967315050057, + "eval_loss": 0.751198947429657, + "eval_mean_token_accuracy": 0.8509796344956686, + "eval_num_tokens": 6165523.0, + "eval_runtime": 85.7958, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.005, + "step": 2640 + }, + { + "entropy": 0.15261746793985367, + "epoch": 6.617683686176837, + "grad_norm": 0.5391237139701843, + "learning_rate": 7.022906815301673e-05, + "loss": 0.0926026999950409, + "mean_token_accuracy": 0.9695659473538398, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.29128045216202736, + "eval_loss": 0.7450292110443115, + "eval_mean_token_accuracy": 0.8498771443616512, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.3963, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 2660 + }, + { + "entropy": 0.16164180357009172, + "epoch": 6.667496886674969, + "grad_norm": 0.5767946243286133, + "learning_rate": 6.841759539535419e-05, + "loss": 0.09291981458663941, + "mean_token_accuracy": 0.9687136687338352, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2897637223088464, + "eval_loss": 0.7503410577774048, + "eval_mean_token_accuracy": 0.8503315164599308, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.0653, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.998, + "step": 2680 + }, + { + "entropy": 0.17062523355707526, + "epoch": 6.717310087173101, + "grad_norm": 0.4974168539047241, + "learning_rate": 6.661961022304563e-05, + "loss": 0.09713236689567566, + "mean_token_accuracy": 0.9661971725523472, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2765843396963075, + "eval_loss": 0.7604002356529236, + "eval_mean_token_accuracy": 0.8521115277395692, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.1676, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 2700 + }, + { + "entropy": 0.17544092936441302, + "epoch": 6.767123287671232, + "grad_norm": 0.5523537993431091, + "learning_rate": 6.483565488389582e-05, + "loss": 0.09709116220474243, + "mean_token_accuracy": 0.9650957375764847, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.27939334659035814, + "eval_loss": 0.7534670829772949, + "eval_mean_token_accuracy": 0.851230604010959, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.2913, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 2720 + }, + { + "entropy": 0.15991022661328316, + "epoch": 6.816936488169365, + "grad_norm": 0.478551983833313, + "learning_rate": 6.306626739450311e-05, + "loss": 0.09564646482467651, + "mean_token_accuracy": 0.9679084822535515, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.27878295491601146, + "eval_loss": 0.7519959211349487, + "eval_mean_token_accuracy": 0.8510654949864676, + "eval_num_tokens": 6397720.0, + "eval_runtime": 85.9109, + "eval_samples_per_second": 16.005, + "eval_steps_per_second": 2.002, + "step": 2740 + }, + { + "entropy": 0.16824879590421915, + "epoch": 6.866749688667497, + "grad_norm": 0.6681098937988281, + "learning_rate": 6.131198137800108e-05, + "loss": 0.0962279736995697, + "mean_token_accuracy": 0.966830012947321, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.2834690434121808, + "eval_loss": 0.751922070980072, + "eval_mean_token_accuracy": 0.8521237577809844, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.3618, + "eval_samples_per_second": 15.921, + "eval_steps_per_second": 1.992, + "step": 2760 + }, + { + "entropy": 0.1518704930320382, + "epoch": 6.916562889165629, + "grad_norm": 0.5201290249824524, + "learning_rate": 5.957332590312513e-05, + "loss": 0.09010660648345947, + "mean_token_accuracy": 0.9693463340401649, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.28485129617674404, + "eval_loss": 0.7452457547187805, + "eval_mean_token_accuracy": 0.8512036796919135, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.4524, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.99, + "step": 2780 + }, + { + "entropy": 0.15512610590085388, + "epoch": 6.966376089663761, + "grad_norm": 0.42802050709724426, + "learning_rate": 5.785082532465233e-05, + "loss": 0.09320432543754578, + "mean_token_accuracy": 0.9686134628951549, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.27554594526110693, + "eval_loss": 0.7644653916358948, + "eval_mean_token_accuracy": 0.8513738523389018, + "eval_num_tokens": 6540175.0, + "eval_runtime": 85.7609, + "eval_samples_per_second": 16.033, + "eval_steps_per_second": 2.006, + "step": 2800 + }, + { + "entropy": 0.17524497526196334, + "epoch": 7.01494396014944, + "grad_norm": 0.3330269157886505, + "learning_rate": 5.6144999125263545e-05, + "loss": 0.0895616888999939, + "mean_token_accuracy": 0.9682766932707566, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.2735865569218647, + "eval_loss": 0.768479585647583, + "eval_mean_token_accuracy": 0.8503459383581959, + "eval_num_tokens": 6583767.0, + "eval_runtime": 85.7162, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.007, + "step": 2820 + }, + { + "entropy": 0.1403565663844347, + "epoch": 7.064757160647572, + "grad_norm": 0.35613498091697693, + "learning_rate": 5.4456361758874235e-05, + "loss": 0.07551313638687134, + "mean_token_accuracy": 0.9739301167428493, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.25941789089593775, + "eval_loss": 0.8209511637687683, + "eval_mean_token_accuracy": 0.8505055855873019, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.0943, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 2840 + }, + { + "entropy": 0.13500106502324344, + "epoch": 7.114570361145703, + "grad_norm": 0.34418627619743347, + "learning_rate": 5.2785422495482234e-05, + "loss": 0.07293946146965027, + "mean_token_accuracy": 0.9747208289802074, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.26482899772912954, + "eval_loss": 0.798904538154602, + "eval_mean_token_accuracy": 0.8511530233677044, + "eval_num_tokens": 6672946.0, + "eval_runtime": 85.7915, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.005, + "step": 2860 + }, + { + "entropy": 0.13127502552233636, + "epoch": 7.164383561643835, + "grad_norm": 0.4638441503047943, + "learning_rate": 5.113268526757892e-05, + "loss": 0.07121461629867554, + "mean_token_accuracy": 0.9756786689162255, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2645381211714689, + "eval_loss": 0.809101939201355, + "eval_mean_token_accuracy": 0.8514727898115335, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.84, + "eval_samples_per_second": 16.018, + "eval_steps_per_second": 2.004, + "step": 2880 + }, + { + "entropy": 0.1331390908919275, + "epoch": 7.214196762141968, + "grad_norm": 0.40206775069236755, + "learning_rate": 4.949864851817007e-05, + "loss": 0.07188264131546021, + "mean_token_accuracy": 0.9755406074225903, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.26244733283339544, + "eval_loss": 0.8143188953399658, + "eval_mean_token_accuracy": 0.8514358189909957, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.8546, + "eval_samples_per_second": 16.015, + "eval_steps_per_second": 2.003, + "step": 2900 + }, + { + "entropy": 0.13647331558167936, + "epoch": 7.2640099626401, + "grad_norm": 0.26405787467956543, + "learning_rate": 4.788380505045224e-05, + "loss": 0.07412450313568116, + "mean_token_accuracy": 0.9744274213910102, + "num_tokens": 6809678.0, + "step": 2920 + }, + { + "epoch": 7.2640099626401, + "eval_entropy": 0.2626111418182074, + "eval_loss": 0.8111525177955627, + "eval_mean_token_accuracy": 0.8512121695418691, + "eval_num_tokens": 6809678.0, + "eval_runtime": 85.9626, + "eval_samples_per_second": 15.995, + "eval_steps_per_second": 2.001, + "step": 2920 + }, + { + "entropy": 0.12644002586603165, + "epoch": 7.313823163138232, + "grad_norm": 0.27514681220054626, + "learning_rate": 4.6288641879189884e-05, + "loss": 0.06807711124420165, + "mean_token_accuracy": 0.9760703906416893, + "num_tokens": 6860750.0, + "step": 2940 + }, + { + "epoch": 7.313823163138232, + "eval_entropy": 0.26096762734097106, + "eval_loss": 0.8184595108032227, + "eval_mean_token_accuracy": 0.8501476153384807, + "eval_num_tokens": 6860750.0, + "eval_runtime": 85.9521, + "eval_samples_per_second": 15.997, + "eval_steps_per_second": 2.001, + "step": 2940 + }, + { + "entropy": 0.13920630998909472, + "epoch": 7.363636363636363, + "grad_norm": 0.23584705591201782, + "learning_rate": 4.4713640083838604e-05, + "loss": 0.07301607131958007, + "mean_token_accuracy": 0.9745715200901032, + "num_tokens": 6907092.0, + "step": 2960 + }, + { + "epoch": 7.363636363636363, + "eval_entropy": 0.2612536767021168, + "eval_loss": 0.8116245269775391, + "eval_mean_token_accuracy": 0.8510967350976412, + "eval_num_tokens": 6907092.0, + "eval_runtime": 85.6373, + "eval_samples_per_second": 16.056, + "eval_steps_per_second": 2.008, + "step": 2960 + }, + { + "entropy": 0.1349492883309722, + "epoch": 7.4134495641344955, + "grad_norm": 0.24552719295024872, + "learning_rate": 4.315927466345791e-05, + "loss": 0.07397544980049134, + "mean_token_accuracy": 0.9745095103979111, + "num_tokens": 6952700.0, + "step": 2980 + }, + { + "epoch": 7.4134495641344955, + "eval_entropy": 0.25796533306670744, + "eval_loss": 0.8266491293907166, + "eval_mean_token_accuracy": 0.8511653857868772, + "eval_num_tokens": 6952700.0, + "eval_runtime": 85.7462, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.006, + "step": 2980 + }, + { + "entropy": 0.14479175000451505, + "epoch": 7.463262764632628, + "grad_norm": 0.2846072018146515, + "learning_rate": 4.162601439345814e-05, + "loss": 0.07544798254966736, + "mean_token_accuracy": 0.9727819666266442, + "num_tokens": 6996430.0, + "step": 3000 + }, + { + "epoch": 7.463262764632628, + "eval_entropy": 0.2584348309698493, + "eval_loss": 0.8253348469734192, + "eval_mean_token_accuracy": 0.8511569815319638, + "eval_num_tokens": 6996430.0, + "eval_runtime": 86.2984, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 3000 + }, + { + "entropy": 0.14114196319133043, + "epoch": 7.51307596513076, + "grad_norm": 0.407966285943985, + "learning_rate": 4.011432168422419e-05, + "loss": 0.0736398994922638, + "mean_token_accuracy": 0.9741654269397259, + "num_tokens": 7042038.0, + "step": 3020 + }, + { + "epoch": 7.51307596513076, + "eval_entropy": 0.25232676260693127, + "eval_loss": 0.8296052813529968, + "eval_mean_token_accuracy": 0.8523298349491385, + "eval_num_tokens": 7042038.0, + "eval_runtime": 85.8445, + "eval_samples_per_second": 16.017, + "eval_steps_per_second": 2.004, + "step": 3020 + }, + { + "entropy": 0.1353456223383546, + "epoch": 7.562889165628892, + "grad_norm": 0.2712634801864624, + "learning_rate": 3.8624652441658684e-05, + "loss": 0.07362412214279175, + "mean_token_accuracy": 0.9747945807874203, + "num_tokens": 7089390.0, + "step": 3040 + }, + { + "epoch": 7.562889165628892, + "eval_entropy": 0.2579477243991785, + "eval_loss": 0.8274564743041992, + "eval_mean_token_accuracy": 0.8517705212498821, + "eval_num_tokens": 7089390.0, + "eval_runtime": 85.8222, + "eval_samples_per_second": 16.022, + "eval_steps_per_second": 2.004, + "step": 3040 + }, + { + "entropy": 0.1296080862637609, + "epoch": 7.6127023661270234, + "grad_norm": 0.2371893972158432, + "learning_rate": 3.715745592968707e-05, + "loss": 0.06971035599708557, + "mean_token_accuracy": 0.9759043246507645, + "num_tokens": 7138002.0, + "step": 3060 + }, + { + "epoch": 7.6127023661270234, + "eval_entropy": 0.25391967083479083, + "eval_loss": 0.8197130560874939, + "eval_mean_token_accuracy": 0.8522267875283264, + "eval_num_tokens": 7138002.0, + "eval_runtime": 85.8796, + "eval_samples_per_second": 16.011, + "eval_steps_per_second": 2.003, + "step": 3060 + }, + { + "entropy": 0.1311203008517623, + "epoch": 7.662515566625156, + "grad_norm": 0.22499267756938934, + "learning_rate": 3.5713174634765967e-05, + "loss": 0.07176244258880615, + "mean_token_accuracy": 0.9754939571022987, + "num_tokens": 7185520.0, + "step": 3080 + }, + { + "epoch": 7.662515566625156, + "eval_entropy": 0.2526215241225653, + "eval_loss": 0.8265154361724854, + "eval_mean_token_accuracy": 0.8519952584837758, + "eval_num_tokens": 7185520.0, + "eval_runtime": 85.8746, + "eval_samples_per_second": 16.012, + "eval_steps_per_second": 2.003, + "step": 3080 + }, + { + "entropy": 0.13420484317466616, + "epoch": 7.712328767123288, + "grad_norm": 0.2398064285516739, + "learning_rate": 3.4292244132434866e-05, + "loss": 0.07559212446212768, + "mean_token_accuracy": 0.9743142127990723, + "num_tokens": 7232170.0, + "step": 3100 + }, + { + "epoch": 7.712328767123288, + "eval_entropy": 0.2484562756537005, + "eval_loss": 0.8312150239944458, + "eval_mean_token_accuracy": 0.8528405119513356, + "eval_num_tokens": 7232170.0, + "eval_runtime": 85.7896, + "eval_samples_per_second": 16.028, + "eval_steps_per_second": 2.005, + "step": 3100 + }, + { + "entropy": 0.11965563679113984, + "epoch": 7.76214196762142, + "grad_norm": 0.3408384919166565, + "learning_rate": 3.2895092955952746e-05, + "loss": 0.0661750853061676, + "mean_token_accuracy": 0.9776600524783134, + "num_tokens": 7282846.0, + "step": 3120 + }, + { + "epoch": 7.76214196762142, + "eval_entropy": 0.2522421533804993, + "eval_loss": 0.8327009677886963, + "eval_mean_token_accuracy": 0.8524222023958383, + "eval_num_tokens": 7282846.0, + "eval_runtime": 86.1769, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 1.996, + "step": 3120 + }, + { + "entropy": 0.13388084415346385, + "epoch": 7.811955168119551, + "grad_norm": 0.35418516397476196, + "learning_rate": 3.152214246705829e-05, + "loss": 0.07149899601936341, + "mean_token_accuracy": 0.9747635535895824, + "num_tokens": 7331518.0, + "step": 3140 + }, + { + "epoch": 7.811955168119551, + "eval_entropy": 0.25038352296795957, + "eval_loss": 0.836457371711731, + "eval_mean_token_accuracy": 0.8526130665180295, + "eval_num_tokens": 7331518.0, + "eval_runtime": 85.6099, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.009, + "step": 3140 + }, + { + "entropy": 0.13530643959529698, + "epoch": 7.861768368617684, + "grad_norm": 0.38060539960861206, + "learning_rate": 3.017380672889291e-05, + "loss": 0.07116585969924927, + "mean_token_accuracy": 0.973284512758255, + "num_tokens": 7379056.0, + "step": 3160 + }, + { + "epoch": 7.861768368617684, + "eval_entropy": 0.255092611319797, + "eval_loss": 0.8314701914787292, + "eval_mean_token_accuracy": 0.8520913099826768, + "eval_num_tokens": 7379056.0, + "eval_runtime": 85.877, + "eval_samples_per_second": 16.011, + "eval_steps_per_second": 2.003, + "step": 3160 + }, + { + "entropy": 0.13383390177041293, + "epoch": 7.911581569115816, + "grad_norm": 0.3827536106109619, + "learning_rate": 2.8850492381124808e-05, + "loss": 0.07305437326431274, + "mean_token_accuracy": 0.9750778004527092, + "num_tokens": 7424770.0, + "step": 3180 + }, + { + "epoch": 7.911581569115816, + "eval_entropy": 0.25416371157003004, + "eval_loss": 0.8206402063369751, + "eval_mean_token_accuracy": 0.852779901651449, + "eval_num_tokens": 7424770.0, + "eval_runtime": 86.1015, + "eval_samples_per_second": 15.97, + "eval_steps_per_second": 1.998, + "step": 3180 + }, + { + "entropy": 0.1395680439658463, + "epoch": 7.961394769613948, + "grad_norm": 0.3809775412082672, + "learning_rate": 2.7552598517312256e-05, + "loss": 0.07236042022705078, + "mean_token_accuracy": 0.9731538116931915, + "num_tokens": 7470804.0, + "step": 3200 + }, + { + "epoch": 7.961394769613948, + "eval_entropy": 0.25528111975899964, + "eval_loss": 0.8230037093162537, + "eval_mean_token_accuracy": 0.8526452603035195, + "eval_num_tokens": 7470804.0, + "eval_runtime": 85.7895, + "eval_samples_per_second": 16.028, + "eval_steps_per_second": 2.005, + "step": 3200 + }, + { + "entropy": 0.12193699864049752, + "epoch": 8.009962640099626, + "grad_norm": 0.11854425817728043, + "learning_rate": 2.6280516564542205e-05, + "loss": 0.06617764234542847, + "mean_token_accuracy": 0.977179691577569, + "num_tokens": 7518110.0, + "step": 3220 + }, + { + "epoch": 8.009962640099626, + "eval_entropy": 0.25100527677771656, + "eval_loss": 0.8393343687057495, + "eval_mean_token_accuracy": 0.8522553132023922, + "eval_num_tokens": 7518110.0, + "eval_runtime": 85.8837, + "eval_samples_per_second": 16.01, + "eval_steps_per_second": 2.003, + "step": 3220 + }, + { + "entropy": 0.12788885813206435, + "epoch": 8.059775840597759, + "grad_norm": 0.16094881296157837, + "learning_rate": 2.50346301653812e-05, + "loss": 0.06274186968803405, + "mean_token_accuracy": 0.9766994707286358, + "num_tokens": 7565539.0, + "step": 3240 + }, + { + "epoch": 8.059775840597759, + "eval_entropy": 0.24409458682287571, + "eval_loss": 0.874617338180542, + "eval_mean_token_accuracy": 0.8521041180505309, + "eval_num_tokens": 7565539.0, + "eval_runtime": 86.2656, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 3240 + }, + { + "entropy": 0.12464155335910618, + "epoch": 8.10958904109589, + "grad_norm": 0.16893954575061798, + "learning_rate": 2.381531506217437e-05, + "loss": 0.06093020439147949, + "mean_token_accuracy": 0.9776258453726768, + "num_tokens": 7612578.0, + "step": 3260 + }, + { + "epoch": 8.10958904109589, + "eval_entropy": 0.24396493017326953, + "eval_loss": 0.891161322593689, + "eval_mean_token_accuracy": 0.8515338024427724, + "eval_num_tokens": 7612578.0, + "eval_runtime": 85.9061, + "eval_samples_per_second": 16.006, + "eval_steps_per_second": 2.002, + "step": 3260 + }, + { + "entropy": 0.12345920228399336, + "epoch": 8.159402241594023, + "grad_norm": 0.14332273602485657, + "learning_rate": 2.262293898372616e-05, + "loss": 0.061289966106414795, + "mean_token_accuracy": 0.9762230902910233, + "num_tokens": 7660157.0, + "step": 3280 + }, + { + "epoch": 8.159402241594023, + "eval_entropy": 0.2481445314059424, + "eval_loss": 0.8922848105430603, + "eval_mean_token_accuracy": 0.8514944855556932, + "eval_num_tokens": 7660157.0, + "eval_runtime": 85.5201, + "eval_samples_per_second": 16.078, + "eval_steps_per_second": 2.011, + "step": 3280 + }, + { + "entropy": 0.12298110066913068, + "epoch": 8.209215442092155, + "grad_norm": 0.21848882734775543, + "learning_rate": 2.1457861534398633e-05, + "loss": 0.05986443758010864, + "mean_token_accuracy": 0.9786281704902648, + "num_tokens": 7709745.0, + "step": 3300 + }, + { + "epoch": 8.209215442092155, + "eval_entropy": 0.24329388124305149, + "eval_loss": 0.9021085500717163, + "eval_mean_token_accuracy": 0.8521762625422589, + "eval_num_tokens": 7709745.0, + "eval_runtime": 85.955, + "eval_samples_per_second": 15.997, + "eval_steps_per_second": 2.001, + "step": 3300 + }, + { + "entropy": 0.13265180448070168, + "epoch": 8.259028642590286, + "grad_norm": 0.18067947030067444, + "learning_rate": 2.0320434085659692e-05, + "loss": 0.06724961400032044, + "mean_token_accuracy": 0.975098168104887, + "num_tokens": 7753571.0, + "step": 3320 + }, + { + "epoch": 8.259028642590286, + "eval_entropy": 0.2433211464694766, + "eval_loss": 0.9094350337982178, + "eval_mean_token_accuracy": 0.8520150094531304, + "eval_num_tokens": 7753571.0, + "eval_runtime": 85.7989, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.005, + "step": 3320 + }, + { + "entropy": 0.11949320202693343, + "epoch": 8.308841843088418, + "grad_norm": 0.17020289599895477, + "learning_rate": 1.9210999670114196e-05, + "loss": 0.0634455680847168, + "mean_token_accuracy": 0.9771294385194779, + "num_tokens": 7799310.0, + "step": 3340 + }, + { + "epoch": 8.308841843088418, + "eval_entropy": 0.24345201219237128, + "eval_loss": 0.9021793603897095, + "eval_mean_token_accuracy": 0.8520745697409607, + "eval_num_tokens": 7799310.0, + "eval_runtime": 86.0883, + "eval_samples_per_second": 15.972, + "eval_steps_per_second": 1.998, + "step": 3340 + }, + { + "entropy": 0.12065747743472457, + "epoch": 8.35865504358655, + "grad_norm": 0.16789060831069946, + "learning_rate": 1.8129892878049886e-05, + "loss": 0.061494195461273195, + "mean_token_accuracy": 0.9779584899544715, + "num_tokens": 7846447.0, + "step": 3360 + }, + { + "epoch": 8.35865504358655, + "eval_entropy": 0.24093415042342142, + "eval_loss": 0.9006755352020264, + "eval_mean_token_accuracy": 0.852174230786257, + "eval_num_tokens": 7846447.0, + "eval_runtime": 85.9011, + "eval_samples_per_second": 16.007, + "eval_steps_per_second": 2.002, + "step": 3360 + }, + { + "entropy": 0.13125578537583352, + "epoch": 8.408468244084682, + "grad_norm": 0.1662452220916748, + "learning_rate": 1.70774397565298e-05, + "loss": 0.06685600876808166, + "mean_token_accuracy": 0.9744067586958408, + "num_tokens": 7890283.0, + "step": 3380 + }, + { + "epoch": 8.408468244084682, + "eval_entropy": 0.24062153688350388, + "eval_loss": 0.9078915119171143, + "eval_mean_token_accuracy": 0.8523201647886011, + "eval_num_tokens": 7890283.0, + "eval_runtime": 86.0201, + "eval_samples_per_second": 15.985, + "eval_steps_per_second": 2.0, + "step": 3380 + }, + { + "entropy": 0.11986117120832204, + "epoch": 8.458281444582815, + "grad_norm": 0.19571948051452637, + "learning_rate": 1.6053957711060606e-05, + "loss": 0.06411095261573792, + "mean_token_accuracy": 0.9770627245306969, + "num_tokens": 7936518.0, + "step": 3400 + }, + { + "epoch": 8.458281444582815, + "eval_entropy": 0.24352820347561394, + "eval_loss": 0.9058943390846252, + "eval_mean_token_accuracy": 0.8519382792156797, + "eval_num_tokens": 7936518.0, + "eval_runtime": 85.966, + "eval_samples_per_second": 15.995, + "eval_steps_per_second": 2.001, + "step": 3400 + }, + { + "entropy": 0.12857897616922856, + "epoch": 8.508094645080947, + "grad_norm": 0.2609264850616455, + "learning_rate": 1.5059755409867613e-05, + "loss": 0.06473397612571716, + "mean_token_accuracy": 0.9764650195837021, + "num_tokens": 7981966.0, + "step": 3420 + }, + { + "epoch": 8.508094645080947, + "eval_entropy": 0.24032609000108962, + "eval_loss": 0.9077776074409485, + "eval_mean_token_accuracy": 0.8517829197090726, + "eval_num_tokens": 7981966.0, + "eval_runtime": 86.6059, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 3420 + }, + { + "entropy": 0.12348870886489749, + "epoch": 8.557907845579079, + "grad_norm": 0.19537609815597534, + "learning_rate": 1.409513269080473e-05, + "loss": 0.06481348872184753, + "mean_token_accuracy": 0.9769559659063816, + "num_tokens": 8028367.0, + "step": 3440 + }, + { + "epoch": 8.557907845579079, + "eval_entropy": 0.2404322574824788, + "eval_loss": 0.9057720899581909, + "eval_mean_token_accuracy": 0.8521037981953732, + "eval_num_tokens": 8028367.0, + "eval_runtime": 86.166, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.996, + "step": 3440 + }, + { + "entropy": 0.12040232736617326, + "epoch": 8.607721046077211, + "grad_norm": 0.3310582935810089, + "learning_rate": 1.3160380470927183e-05, + "loss": 0.06468871235847473, + "mean_token_accuracy": 0.9768650442361831, + "num_tokens": 8074934.0, + "step": 3460 + }, + { + "epoch": 8.607721046077211, + "eval_entropy": 0.24118655876711356, + "eval_loss": 0.9028318524360657, + "eval_mean_token_accuracy": 0.8521025340224422, + "eval_num_tokens": 8074934.0, + "eval_runtime": 85.3668, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.015, + "step": 3460 + }, + { + "entropy": 0.12328103906475008, + "epoch": 8.657534246575342, + "grad_norm": 0.12836167216300964, + "learning_rate": 1.2255780658755122e-05, + "loss": 0.06229386329650879, + "mean_token_accuracy": 0.9763277888298034, + "num_tokens": 8122775.0, + "step": 3480 + }, + { + "epoch": 8.657534246575342, + "eval_entropy": 0.24194598145956217, + "eval_loss": 0.9009329080581665, + "eval_mean_token_accuracy": 0.8521693289973015, + "eval_num_tokens": 8122775.0, + "eval_runtime": 85.9415, + "eval_samples_per_second": 15.999, + "eval_steps_per_second": 2.001, + "step": 3480 + }, + { + "entropy": 0.11321646976284683, + "epoch": 8.707347447073474, + "grad_norm": 0.15656894445419312, + "learning_rate": 1.1381606069253786e-05, + "loss": 0.05908188819885254, + "mean_token_accuracy": 0.9779504477977753, + "num_tokens": 8174307.0, + "step": 3500 + }, + { + "epoch": 8.707347447073474, + "eval_entropy": 0.24121542517528977, + "eval_loss": 0.9016091823577881, + "eval_mean_token_accuracy": 0.8521790667328724, + "eval_num_tokens": 8174307.0, + "eval_runtime": 85.7465, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.006, + "step": 3500 + }, + { + "entropy": 0.12657046681270004, + "epoch": 8.757160647571606, + "grad_norm": 0.22597502171993256, + "learning_rate": 1.053812034155629e-05, + "loss": 0.06244581937789917, + "mean_token_accuracy": 0.976795207709074, + "num_tokens": 8222808.0, + "step": 3520 + }, + { + "epoch": 8.757160647571606, + "eval_entropy": 0.23877542708502258, + "eval_loss": 0.9069110155105591, + "eval_mean_token_accuracy": 0.8522880177858264, + "eval_num_tokens": 8222808.0, + "eval_runtime": 85.7792, + "eval_samples_per_second": 16.03, + "eval_steps_per_second": 2.005, + "step": 3520 + }, + { + "entropy": 0.11422101808711886, + "epoch": 8.806973848069738, + "grad_norm": 0.21139323711395264, + "learning_rate": 9.725577859453502e-06, + "loss": 0.05988085865974426, + "mean_token_accuracy": 0.9779510758817196, + "num_tokens": 8273335.0, + "step": 3540 + }, + { + "epoch": 8.806973848069738, + "eval_entropy": 0.2393161087881687, + "eval_loss": 0.9033801555633545, + "eval_mean_token_accuracy": 0.8522614209457885, + "eval_num_tokens": 8273335.0, + "eval_runtime": 85.5594, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 3540 + }, + { + "entropy": 0.13810604228638113, + "epoch": 8.85678704856787, + "grad_norm": 0.24571993947029114, + "learning_rate": 8.944223674675537e-06, + "loss": 0.07036117911338806, + "mean_token_accuracy": 0.9734892748296261, + "num_tokens": 8315235.0, + "step": 3560 + }, + { + "epoch": 8.85678704856787, + "eval_entropy": 0.23998506947658782, + "eval_loss": 0.9009848833084106, + "eval_mean_token_accuracy": 0.8521793619837872, + "eval_num_tokens": 8315235.0, + "eval_runtime": 86.0974, + "eval_samples_per_second": 15.97, + "eval_steps_per_second": 1.998, + "step": 3560 + }, + { + "entropy": 0.14193559321574867, + "epoch": 8.906600249066003, + "grad_norm": 0.17304112017154694, + "learning_rate": 8.194293432987386e-06, + "loss": 0.07077967524528503, + "mean_token_accuracy": 0.973305893689394, + "num_tokens": 8358099.0, + "step": 3580 + }, + { + "epoch": 8.906600249066003, + "eval_entropy": 0.23883876689644748, + "eval_loss": 0.9015622138977051, + "eval_mean_token_accuracy": 0.8524864378363587, + "eval_num_tokens": 8358099.0, + "eval_runtime": 86.0089, + "eval_samples_per_second": 15.987, + "eval_steps_per_second": 2.0, + "step": 3580 + }, + { + "entropy": 0.11878943420015275, + "epoch": 8.956413449564135, + "grad_norm": 0.19075658917427063, + "learning_rate": 7.476013303121426e-06, + "loss": 0.060806107521057126, + "mean_token_accuracy": 0.9776863709092141, + "num_tokens": 8407430.0, + "step": 3600 + }, + { + "epoch": 8.956413449564135, + "eval_entropy": 0.23726526309931, + "eval_loss": 0.9060276746749878, + "eval_mean_token_accuracy": 0.8524192058762838, + "eval_num_tokens": 8407430.0, + "eval_runtime": 85.7252, + "eval_samples_per_second": 16.04, + "eval_steps_per_second": 2.006, + "step": 3600 + }, + { + "entropy": 0.1255835090787747, + "epoch": 9.004981320049813, + "grad_norm": 0.11608047038316727, + "learning_rate": 6.78959990856799e-06, + "loss": 0.06319612860679627, + "mean_token_accuracy": 0.9766685519462976, + "num_tokens": 8453175.0, + "step": 3620 + }, + { + "epoch": 9.004981320049813, + "eval_entropy": 0.2373251837006835, + "eval_loss": 0.9045722484588623, + "eval_mean_token_accuracy": 0.8525558363559634, + "eval_num_tokens": 8453175.0, + "eval_runtime": 85.7435, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.006, + "step": 3620 + }, + { + "entropy": 0.12587778437882663, + "epoch": 9.054794520547945, + "grad_norm": 0.1564614623785019, + "learning_rate": 6.135260262244683e-06, + "loss": 0.0630365788936615, + "mean_token_accuracy": 0.9777486085891723, + "num_tokens": 8497151.0, + "step": 3640 + }, + { + "epoch": 9.054794520547945, + "eval_entropy": 0.23559923721260803, + "eval_loss": 0.9120694398880005, + "eval_mean_token_accuracy": 0.8525292966947999, + "eval_num_tokens": 8497151.0, + "eval_runtime": 85.8018, + "eval_samples_per_second": 16.025, + "eval_steps_per_second": 2.005, + "step": 3640 + }, + { + "entropy": 0.12535365503281354, + "epoch": 9.104607721046078, + "grad_norm": 0.1404249221086502, + "learning_rate": 5.513191704064086e-06, + "loss": 0.060502654314041136, + "mean_token_accuracy": 0.9770058333873749, + "num_tokens": 8542996.0, + "step": 3660 + }, + { + "epoch": 9.104607721046078, + "eval_entropy": 0.23525122691725575, + "eval_loss": 0.9182237982749939, + "eval_mean_token_accuracy": 0.8524098333924316, + "eval_num_tokens": 8542996.0, + "eval_runtime": 85.9872, + "eval_samples_per_second": 15.991, + "eval_steps_per_second": 2.0, + "step": 3660 + }, + { + "entropy": 0.11330419047735632, + "epoch": 9.15442092154421, + "grad_norm": 0.15513843297958374, + "learning_rate": 4.92358184141876e-06, + "loss": 0.05822383761405945, + "mean_token_accuracy": 0.9793384782969952, + "num_tokens": 8591625.0, + "step": 3680 + }, + { + "epoch": 9.15442092154421, + "eval_entropy": 0.2353947116711805, + "eval_loss": 0.9229223132133484, + "eval_mean_token_accuracy": 0.852500357253607, + "eval_num_tokens": 8591625.0, + "eval_runtime": 86.0805, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.998, + "step": 3680 + }, + { + "entropy": 0.11830627010203898, + "epoch": 9.204234122042342, + "grad_norm": 0.1730550080537796, + "learning_rate": 4.366608492601456e-06, + "loss": 0.05860854983329773, + "mean_token_accuracy": 0.9779663667082786, + "num_tokens": 8639845.0, + "step": 3700 + }, + { + "epoch": 9.204234122042342, + "eval_entropy": 0.23567205719476522, + "eval_loss": 0.9269373416900635, + "eval_mean_token_accuracy": 0.8523658004611038, + "eval_num_tokens": 8639845.0, + "eval_runtime": 85.9809, + "eval_samples_per_second": 15.992, + "eval_steps_per_second": 2.0, + "step": 3700 + }, + { + "entropy": 0.1180900705512613, + "epoch": 9.254047322540472, + "grad_norm": 0.20909737050533295, + "learning_rate": 3.842439633177387e-06, + "loss": 0.059438884258270264, + "mean_token_accuracy": 0.9786856278777123, + "num_tokens": 8687194.0, + "step": 3720 + }, + { + "epoch": 9.254047322540472, + "eval_entropy": 0.23602714493524196, + "eval_loss": 0.9293538928031921, + "eval_mean_token_accuracy": 0.8523273440294488, + "eval_num_tokens": 8687194.0, + "eval_runtime": 85.2118, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.019, + "step": 3720 + }, + { + "entropy": 0.13156692241318524, + "epoch": 9.303860523038605, + "grad_norm": 0.12535709142684937, + "learning_rate": 3.3512333453253305e-06, + "loss": 0.06337688565254211, + "mean_token_accuracy": 0.9756712593138218, + "num_tokens": 8731721.0, + "step": 3740 + }, + { + "epoch": 9.303860523038605, + "eval_entropy": 0.23534389351343, + "eval_loss": 0.932999312877655, + "eval_mean_token_accuracy": 0.8523333925147389, + "eval_num_tokens": 8731721.0, + "eval_runtime": 85.953, + "eval_samples_per_second": 15.997, + "eval_steps_per_second": 2.001, + "step": 3740 + }, + { + "entropy": 0.12327516414225101, + "epoch": 9.353673723536737, + "grad_norm": 0.16341575980186462, + "learning_rate": 2.8931377701619306e-06, + "loss": 0.05869622826576233, + "mean_token_accuracy": 0.9784224212169648, + "num_tokens": 8778614.0, + "step": 3760 + }, + { + "epoch": 9.353673723536737, + "eval_entropy": 0.23493653622477553, + "eval_loss": 0.9358566999435425, + "eval_mean_token_accuracy": 0.8522722783476807, + "eval_num_tokens": 8778614.0, + "eval_runtime": 85.2538, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.018, + "step": 3760 + }, + { + "entropy": 0.1134357453789562, + "epoch": 9.403486924034869, + "grad_norm": 0.23999616503715515, + "learning_rate": 2.4682910630645723e-06, + "loss": 0.057540220022201535, + "mean_token_accuracy": 0.9798057802021504, + "num_tokens": 8826551.0, + "step": 3780 + }, + { + "epoch": 9.403486924034869, + "eval_entropy": 0.23470525634150172, + "eval_loss": 0.937556266784668, + "eval_mean_token_accuracy": 0.8523351706044618, + "eval_num_tokens": 8826551.0, + "eval_runtime": 85.7764, + "eval_samples_per_second": 16.03, + "eval_steps_per_second": 2.005, + "step": 3780 + }, + { + "entropy": 0.1075570048764348, + "epoch": 9.453300124533001, + "grad_norm": 0.15417765080928802, + "learning_rate": 2.0768213520055406e-06, + "loss": 0.05581026673316956, + "mean_token_accuracy": 0.9797527104616165, + "num_tokens": 8876556.0, + "step": 3800 + }, + { + "epoch": 9.453300124533001, + "eval_entropy": 0.2347462713545145, + "eval_loss": 0.9383137226104736, + "eval_mean_token_accuracy": 0.8522575324357942, + "eval_num_tokens": 8876556.0, + "eval_runtime": 85.8985, + "eval_samples_per_second": 16.007, + "eval_steps_per_second": 2.002, + "step": 3800 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.74812402802731e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3820/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3820/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3820/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3820/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3820/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3820/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3820/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3820/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3820/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3820/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3820/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3820/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3820/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3820/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..53f9f3117f84554f3478a67ddbace0bed1b147ff --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3820/trainer_state.json @@ -0,0 +1,4045 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 9.503113325031133, + "eval_steps": 20, + "global_step": 3820, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + }, + { + "entropy": 0.561330484598875, + "epoch": 1.891656288916563, + "grad_norm": 0.6722865700721741, + "learning_rate": 0.0002208867897174789, + "loss": 0.499837589263916, + "mean_token_accuracy": 0.8518734864890576, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.5865232653396074, + "eval_loss": 0.5437926650047302, + "eval_mean_token_accuracy": 0.8450997017843779, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4116, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.547389242425561, + "epoch": 1.9414694894146949, + "grad_norm": 0.7935577034950256, + "learning_rate": 0.00022027119820226907, + "loss": 0.4977591514587402, + "mean_token_accuracy": 0.8539491161704064, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.5290903090391048, + "eval_loss": 0.5409526824951172, + "eval_mean_token_accuracy": 0.8497545698354411, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.7262, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 780 + }, + { + "entropy": 0.5687909748405218, + "epoch": 1.9912826899128269, + "grad_norm": 0.6180546283721924, + "learning_rate": 0.00021962329729698345, + "loss": 0.5109643459320068, + "mean_token_accuracy": 0.8521598495543004, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.5503541858390321, + "eval_loss": 0.5361555218696594, + "eval_mean_token_accuracy": 0.8510884285666221, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.3339, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 800 + }, + { + "entropy": 0.4739728841261986, + "epoch": 2.0398505603985058, + "grad_norm": 0.8058829307556152, + "learning_rate": 0.0002189432823996982, + "loss": 0.4204097747802734, + "mean_token_accuracy": 0.8728981889211215, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.5077334992414297, + "eval_loss": 0.5531114339828491, + "eval_mean_token_accuracy": 0.8489257208136625, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.4801, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.989, + "step": 820 + }, + { + "entropy": 0.4594309840351343, + "epoch": 2.0896637608966375, + "grad_norm": 0.6906896829605103, + "learning_rate": 0.0002182313585936314, + "loss": 0.4071959495544434, + "mean_token_accuracy": 0.8732857562601566, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.49850136994622474, + "eval_loss": 0.5486204624176025, + "eval_mean_token_accuracy": 0.8507991450470548, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.3364, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.4881629109382629, + "epoch": 2.1394769613947697, + "grad_norm": 0.6343470215797424, + "learning_rate": 0.0002174877405852928, + "loss": 0.41669540405273436, + "mean_token_accuracy": 0.8711295068264008, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.49155513924914734, + "eval_loss": 0.555109441280365, + "eval_mean_token_accuracy": 0.8496399400539176, + "eval_num_tokens": 2008562.0, + "eval_runtime": 86.3295, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 860 + }, + { + "entropy": 0.4648668970912695, + "epoch": 2.1892901618929015, + "grad_norm": 0.8014165163040161, + "learning_rate": 0.00021671265263973133, + "loss": 0.4110250473022461, + "mean_token_accuracy": 0.8754166305065155, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.4909258722219356, + "eval_loss": 0.5539511442184448, + "eval_mean_token_accuracy": 0.8492401502160138, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.3468, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 880 + }, + { + "entropy": 0.4824485514312983, + "epoch": 2.2391033623910337, + "grad_norm": 0.6665191054344177, + "learning_rate": 0.00021590632851289967, + "loss": 0.4181404113769531, + "mean_token_accuracy": 0.8726993151009083, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.4986876940657926, + "eval_loss": 0.547695517539978, + "eval_mean_token_accuracy": 0.8501384708770486, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.3838, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 900 + }, + { + "entropy": 0.4751896943897009, + "epoch": 2.2889165628891655, + "grad_norm": 0.81158047914505, + "learning_rate": 0.00021506901138115678, + "loss": 0.40689678192138673, + "mean_token_accuracy": 0.8745221219956875, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.507153491121392, + "eval_loss": 0.5501641631126404, + "eval_mean_token_accuracy": 0.8495670116918032, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.0912, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 920 + }, + { + "entropy": 0.4873133715242147, + "epoch": 2.3387297633872977, + "grad_norm": 0.7218056321144104, + "learning_rate": 0.0002142009537679292, + "loss": 0.42701358795166017, + "mean_token_accuracy": 0.8695114746689796, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5202612736543943, + "eval_loss": 0.5491839051246643, + "eval_mean_token_accuracy": 0.8494071208460386, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.1142, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 940 + }, + { + "entropy": 0.4762951169162989, + "epoch": 2.3885429638854294, + "grad_norm": 0.7194424867630005, + "learning_rate": 0.0002133024174675534, + "loss": 0.42299847602844237, + "mean_token_accuracy": 0.8709790132939815, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4899340462546016, + "eval_loss": 0.5522511601448059, + "eval_mean_token_accuracy": 0.8492208258357159, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.463, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 960 + }, + { + "entropy": 0.49650347977876663, + "epoch": 2.4383561643835616, + "grad_norm": 0.8406022787094116, + "learning_rate": 0.0002123736734663221, + "loss": 0.4275330066680908, + "mean_token_accuracy": 0.8670595556497573, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.49691385654515996, + "eval_loss": 0.5491269826889038, + "eval_mean_token_accuracy": 0.850309816210769, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.17, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 980 + }, + { + "entropy": 0.48843890577554705, + "epoch": 2.488169364881694, + "grad_norm": 0.9082473516464233, + "learning_rate": 0.00021141500186075868, + "loss": 0.4309722423553467, + "mean_token_accuracy": 0.8686766296625137, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5543508351195691, + "eval_loss": 0.5478800535202026, + "eval_mean_token_accuracy": 0.8478029522784921, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.3835, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 1000 + }, + { + "entropy": 0.4777219031006098, + "epoch": 2.5379825653798256, + "grad_norm": 0.7448089122772217, + "learning_rate": 0.0002104266917731438, + "loss": 0.423325252532959, + "mean_token_accuracy": 0.8706337086856365, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.49857561550168106, + "eval_loss": 0.5511948466300964, + "eval_mean_token_accuracy": 0.8502220289651737, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.5399, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.988, + "step": 1020 + }, + { + "entropy": 0.4844174191355705, + "epoch": 2.587795765877958, + "grad_norm": 0.794029176235199, + "learning_rate": 0.00020940904126432, + "loss": 0.4176753044128418, + "mean_token_accuracy": 0.873535567522049, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.485467542222766, + "eval_loss": 0.5539286732673645, + "eval_mean_token_accuracy": 0.8495475081510322, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.135, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 1.997, + "step": 1040 + }, + { + "entropy": 0.49070929251611234, + "epoch": 2.6376089663760895, + "grad_norm": 0.7558256983757019, + "learning_rate": 0.0002083623572438007, + "loss": 0.42867293357849123, + "mean_token_accuracy": 0.8696666076779366, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.490822730889154, + "eval_loss": 0.5434785485267639, + "eval_mean_token_accuracy": 0.850568296950917, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.4933, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 1060 + }, + { + "entropy": 0.47806114703416824, + "epoch": 2.6874221668742218, + "grad_norm": 0.6608979105949402, + "learning_rate": 0.00020728695537721047, + "loss": 0.4289727687835693, + "mean_token_accuracy": 0.8693130135536193, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.5285773256490397, + "eval_loss": 0.5444230437278748, + "eval_mean_token_accuracy": 0.8498796481032704, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.7091, + "eval_samples_per_second": 15.858, + "eval_steps_per_second": 1.984, + "step": 1080 + }, + { + "entropy": 0.5046216730028391, + "epoch": 2.7372353673723535, + "grad_norm": 0.8428544998168945, + "learning_rate": 0.00020618315999108454, + "loss": 0.43131070137023925, + "mean_token_accuracy": 0.8701941035687923, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.49888394738352576, + "eval_loss": 0.5459766387939453, + "eval_mean_token_accuracy": 0.8511758872935938, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.2222, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.995, + "step": 1100 + }, + { + "entropy": 0.5212558470666409, + "epoch": 2.7870485678704857, + "grad_norm": 1.129318118095398, + "learning_rate": 0.00020505130397505635, + "loss": 0.44249300956726073, + "mean_token_accuracy": 0.8654101334512234, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5179622324053631, + "eval_loss": 0.5522801280021667, + "eval_mean_token_accuracy": 0.8497019947268242, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.1903, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.996, + "step": 1120 + }, + { + "entropy": 0.4988406613469124, + "epoch": 2.8368617683686175, + "grad_norm": 0.6460545063018799, + "learning_rate": 0.00020389172868146263, + "loss": 0.4386270523071289, + "mean_token_accuracy": 0.8690383620560169, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.5042278484203094, + "eval_loss": 0.5433034300804138, + "eval_mean_token_accuracy": 0.8497674451317898, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.3028, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.993, + "step": 1140 + }, + { + "entropy": 0.4926559619605541, + "epoch": 2.8866749688667497, + "grad_norm": 0.8199329972267151, + "learning_rate": 0.00020270478382239615, + "loss": 0.4313485145568848, + "mean_token_accuracy": 0.8674727231264114, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.503873193160046, + "eval_loss": 0.5388111472129822, + "eval_mean_token_accuracy": 0.8526195034731266, + "eval_num_tokens": 2710196.0, + "eval_runtime": 86.4054, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.991, + "step": 1160 + }, + { + "entropy": 0.5020013231784105, + "epoch": 2.936488169364882, + "grad_norm": 0.7344821095466614, + "learning_rate": 0.00020149082736423723, + "loss": 0.43590536117553713, + "mean_token_accuracy": 0.8671772189438343, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5368241809828337, + "eval_loss": 0.5355703830718994, + "eval_mean_token_accuracy": 0.8517617773871089, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.2945, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1180 + }, + { + "entropy": 0.5112275708466768, + "epoch": 2.9863013698630136, + "grad_norm": 0.6951606869697571, + "learning_rate": 0.00020025022541969622, + "loss": 0.43579301834106443, + "mean_token_accuracy": 0.8641206480562686, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.5066795706055885, + "eval_loss": 0.5415249466896057, + "eval_mean_token_accuracy": 0.8493563373421513, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.5005, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.988, + "step": 1200 + }, + { + "entropy": 0.42298635305502474, + "epoch": 3.0348692403486925, + "grad_norm": 0.8201794028282166, + "learning_rate": 0.00019898335213739863, + "loss": 0.35593905448913576, + "mean_token_accuracy": 0.889238600547497, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.4584170470750609, + "eval_loss": 0.569487452507019, + "eval_mean_token_accuracy": 0.8495814173027526, + "eval_num_tokens": 2848509.0, + "eval_runtime": 86.2281, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 1220 + }, + { + "entropy": 0.37450140453875064, + "epoch": 3.0846824408468243, + "grad_norm": 0.7308394908905029, + "learning_rate": 0.0001976905895890471, + "loss": 0.307823920249939, + "mean_token_accuracy": 0.9001288741827012, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.45185995916294497, + "eval_loss": 0.5672881603240967, + "eval_mean_token_accuracy": 0.8511318519364955, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.0819, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.998, + "step": 1240 + }, + { + "entropy": 0.3887945845723152, + "epoch": 3.1344956413449565, + "grad_norm": 0.7299330830574036, + "learning_rate": 0.0001963723276541939, + "loss": 0.32047903537750244, + "mean_token_accuracy": 0.8960984498262405, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.44865354549053105, + "eval_loss": 0.5666037201881409, + "eval_mean_token_accuracy": 0.8496572649063066, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 1260 + }, + { + "entropy": 0.39677664265036583, + "epoch": 3.1843088418430883, + "grad_norm": 0.9533219933509827, + "learning_rate": 0.00019502896390265838, + "loss": 0.3253983497619629, + "mean_token_accuracy": 0.8964207418262958, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.4641980809527774, + "eval_loss": 0.5814996957778931, + "eval_mean_token_accuracy": 0.8485886212005171, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.7784, + "eval_samples_per_second": 15.845, + "eval_steps_per_second": 1.982, + "step": 1280 + }, + { + "entropy": 0.39210722744464876, + "epoch": 3.2341220423412205, + "grad_norm": 0.7447651028633118, + "learning_rate": 0.00019366090347462545, + "loss": 0.3276803970336914, + "mean_token_accuracy": 0.8930055953562259, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43595615254585135, + "eval_loss": 0.5722188353538513, + "eval_mean_token_accuracy": 0.8501105755567551, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.5271, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 1300 + }, + { + "entropy": 0.3684127271175385, + "epoch": 3.2839352428393527, + "grad_norm": 0.6934201121330261, + "learning_rate": 0.00019226855895846078, + "loss": 0.3156379222869873, + "mean_token_accuracy": 0.8976306475698947, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.4628148723480313, + "eval_loss": 0.5631352066993713, + "eval_mean_token_accuracy": 0.8504934813394103, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.3436, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 1320 + }, + { + "entropy": 0.4073401909321547, + "epoch": 3.3337484433374844, + "grad_norm": 0.9386897683143616, + "learning_rate": 0.00019085235026627994, + "loss": 0.34265310764312745, + "mean_token_accuracy": 0.8902062118053437, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.46455050623694133, + "eval_loss": 0.5586736798286438, + "eval_mean_token_accuracy": 0.8506874702004499, + "eval_num_tokens": 3132874.0, + "eval_runtime": 86.1286, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.997, + "step": 1340 + }, + { + "entropy": 0.4046429242938757, + "epoch": 3.383561643835616, + "grad_norm": 0.9633992314338684, + "learning_rate": 0.00018941270450730836, + "loss": 0.33816893100738527, + "mean_token_accuracy": 0.8927541889250279, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.46846531660750856, + "eval_loss": 0.561501681804657, + "eval_mean_token_accuracy": 0.8496256377114806, + "eval_num_tokens": 3178055.0, + "eval_runtime": 86.685, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1360 + }, + { + "entropy": 0.39872407019138334, + "epoch": 3.4333748443337484, + "grad_norm": 0.7786458730697632, + "learning_rate": 0.00018795005585907113, + "loss": 0.33342490196228025, + "mean_token_accuracy": 0.8944805048406124, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.42709505973860273, + "eval_loss": 0.5751848220825195, + "eval_mean_token_accuracy": 0.8507290447867194, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.6892, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 1380 + }, + { + "entropy": 0.3923338124528527, + "epoch": 3.4831880448318806, + "grad_norm": 0.9305956363677979, + "learning_rate": 0.0001864648454364511, + "loss": 0.33188116550445557, + "mean_token_accuracy": 0.8943330392241478, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.4386174779298694, + "eval_loss": 0.5680831074714661, + "eval_mean_token_accuracy": 0.8513129727784977, + "eval_num_tokens": 3274096.0, + "eval_runtime": 86.2671, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 1400 + }, + { + "entropy": 0.3856233984231949, + "epoch": 3.5330012453300124, + "grad_norm": 1.0362752676010132, + "learning_rate": 0.0001849575211586545, + "loss": 0.33098697662353516, + "mean_token_accuracy": 0.8961390435695649, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4574795474493226, + "eval_loss": 0.5630439519882202, + "eval_mean_token_accuracy": 0.8520988873964133, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.6035, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 1420 + }, + { + "entropy": 0.39812871962785723, + "epoch": 3.5828144458281446, + "grad_norm": 0.7807195782661438, + "learning_rate": 0.0001834285376141247, + "loss": 0.3333771228790283, + "mean_token_accuracy": 0.8930827379226685, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.4556825893909432, + "eval_loss": 0.5689062476158142, + "eval_mean_token_accuracy": 0.8507103507601937, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.1606, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.996, + "step": 1440 + }, + { + "entropy": 0.4147744856774807, + "epoch": 3.6326276463262763, + "grad_norm": 0.6429352164268494, + "learning_rate": 0.00018187835592344443, + "loss": 0.3482560873031616, + "mean_token_accuracy": 0.8910200245678425, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.46600024540757023, + "eval_loss": 0.5609709024429321, + "eval_mean_token_accuracy": 0.8491220876227977, + "eval_num_tokens": 3415600.0, + "eval_runtime": 86.8039, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1460 + }, + { + "entropy": 0.40425071083009245, + "epoch": 3.6824408468244085, + "grad_norm": 0.8613698482513428, + "learning_rate": 0.0001803074436002682, + "loss": 0.342916464805603, + "mean_token_accuracy": 0.8916418336331844, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.43855057899342026, + "eval_loss": 0.5720968246459961, + "eval_mean_token_accuracy": 0.8500823641932288, + "eval_num_tokens": 3460471.0, + "eval_runtime": 86.6746, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1480 + }, + { + "entropy": 0.39465143866837027, + "epoch": 3.7322540473225407, + "grad_norm": 0.6285189986228943, + "learning_rate": 0.0001787162744103265, + "loss": 0.3424591779708862, + "mean_token_accuracy": 0.8906558901071548, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4509461877304454, + "eval_loss": 0.5590082406997681, + "eval_mean_token_accuracy": 0.8511747371318729, + "eval_num_tokens": 3507647.0, + "eval_runtime": 86.8126, + "eval_samples_per_second": 15.839, + "eval_steps_per_second": 1.981, + "step": 1500 + }, + { + "entropy": 0.4021005939692259, + "epoch": 3.7820672478206725, + "grad_norm": 0.8821248412132263, + "learning_rate": 0.00017710532822854468, + "loss": 0.3462103843688965, + "mean_token_accuracy": 0.889109355956316, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.4502199075596277, + "eval_loss": 0.566046416759491, + "eval_mean_token_accuracy": 0.8501714208098345, + "eval_num_tokens": 3548934.0, + "eval_runtime": 86.8336, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.981, + "step": 1520 + }, + { + "entropy": 0.4017397932708263, + "epoch": 3.8318804483188043, + "grad_norm": 0.8400952816009521, + "learning_rate": 0.0001754750908943189, + "loss": 0.34890995025634763, + "mean_token_accuracy": 0.8892098367214203, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.4614003023435903, + "eval_loss": 0.5617933869361877, + "eval_mean_token_accuracy": 0.8515863616106122, + "eval_num_tokens": 3597186.0, + "eval_runtime": 86.4609, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 1540 + }, + { + "entropy": 0.4112051840871572, + "epoch": 3.8816936488169365, + "grad_norm": 0.769478440284729, + "learning_rate": 0.0001738260540649939, + "loss": 0.34711437225341796, + "mean_token_accuracy": 0.8911717928946018, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4540443811998811, + "eval_loss": 0.5576469898223877, + "eval_mean_token_accuracy": 0.8512079674144124, + "eval_num_tokens": 3646646.0, + "eval_runtime": 86.5103, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 1560 + }, + { + "entropy": 0.41105241514742374, + "epoch": 3.9315068493150687, + "grad_norm": 0.8468427062034607, + "learning_rate": 0.00017215871506758568, + "loss": 0.3433023452758789, + "mean_token_accuracy": 0.8898739732801915, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.4707539707075718, + "eval_loss": 0.5641466379165649, + "eval_mean_token_accuracy": 0.8495440957851188, + "eval_num_tokens": 3689560.0, + "eval_runtime": 86.609, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.986, + "step": 1580 + }, + { + "entropy": 0.41016379147768023, + "epoch": 3.9813200498132004, + "grad_norm": 0.7482675313949585, + "learning_rate": 0.0001704735767487946, + "loss": 0.34550890922546384, + "mean_token_accuracy": 0.8893028847873211, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.46391099864660307, + "eval_loss": 0.5593640804290771, + "eval_mean_token_accuracy": 0.8510130581467651, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.3975, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 1600 + }, + { + "entropy": 0.33167599791135544, + "epoch": 4.029887920298879, + "grad_norm": 0.9435692429542542, + "learning_rate": 0.00016877114732335337, + "loss": 0.2716026544570923, + "mean_token_accuracy": 0.9133149828666296, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.38499350005457567, + "eval_loss": 0.6298249363899231, + "eval_mean_token_accuracy": 0.8488117071778275, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.2933, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1620 + }, + { + "entropy": 0.3000166634097695, + "epoch": 4.0797011207970115, + "grad_norm": 0.8080845475196838, + "learning_rate": 0.0001670519402207569, + "loss": 0.22617182731628419, + "mean_token_accuracy": 0.9253474645316601, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.370110988703578, + "eval_loss": 0.6338461637496948, + "eval_mean_token_accuracy": 0.8485634801692741, + "eval_num_tokens": 3828830.0, + "eval_runtime": 85.9508, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.001, + "step": 1640 + }, + { + "entropy": 0.2986910421401262, + "epoch": 4.129514321295143, + "grad_norm": 0.7310900092124939, + "learning_rate": 0.0001653164739304185, + "loss": 0.22367463111877442, + "mean_token_accuracy": 0.9252275295555592, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.3944379702037157, + "eval_loss": 0.6109381914138794, + "eval_mean_token_accuracy": 0.849291454220927, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.6728, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1660 + }, + { + "entropy": 0.3095553796738386, + "epoch": 4.179327521793275, + "grad_norm": 0.7059140801429749, + "learning_rate": 0.0001635652718453007, + "loss": 0.23651680946350098, + "mean_token_accuracy": 0.9208931416273117, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.3910588648949945, + "eval_loss": 0.6104469299316406, + "eval_mean_token_accuracy": 0.8486883893262508, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7612, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.982, + "step": 1680 + }, + { + "entropy": 0.3001101028174162, + "epoch": 4.229140722291407, + "grad_norm": 0.6787802577018738, + "learning_rate": 0.00016179886210406728, + "loss": 0.23130471706390382, + "mean_token_accuracy": 0.9233332790434361, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3794369170832079, + "eval_loss": 0.6182110905647278, + "eval_mean_token_accuracy": 0.8495433777570724, + "eval_num_tokens": 3967474.0, + "eval_runtime": 85.94, + "eval_samples_per_second": 16.0, + "eval_steps_per_second": 2.001, + "step": 1700 + }, + { + "entropy": 0.3031421799212694, + "epoch": 4.2789539227895395, + "grad_norm": 0.9732038378715515, + "learning_rate": 0.0001600177774318036, + "loss": 0.2359529733657837, + "mean_token_accuracy": 0.9217648565769195, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3923123094231583, + "eval_loss": 0.6057384610176086, + "eval_mean_token_accuracy": 0.8508818288182103, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7647, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.29365369994193313, + "epoch": 4.328767123287671, + "grad_norm": 0.7681498527526855, + "learning_rate": 0.0001582225549793541, + "loss": 0.2269371747970581, + "mean_token_accuracy": 0.9245341829955578, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.4011661055129628, + "eval_loss": 0.6144486665725708, + "eval_mean_token_accuracy": 0.8480324357054955, + "eval_num_tokens": 4062594.0, + "eval_runtime": 87.1306, + "eval_samples_per_second": 15.781, + "eval_steps_per_second": 1.974, + "step": 1740 + }, + { + "entropy": 0.29396994728595016, + "epoch": 4.378580323785803, + "grad_norm": 1.0001007318496704, + "learning_rate": 0.0001564137361613248, + "loss": 0.22777395248413085, + "mean_token_accuracy": 0.9262309700250626, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38518730195802314, + "eval_loss": 0.6202630400657654, + "eval_mean_token_accuracy": 0.8493869807137999, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6616, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.3096018506214023, + "epoch": 4.428393524283935, + "grad_norm": 1.0448365211486816, + "learning_rate": 0.00015459186649280024, + "loss": 0.23696351051330566, + "mean_token_accuracy": 0.9217322513461113, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.3946371126140273, + "eval_loss": 0.6079026460647583, + "eval_mean_token_accuracy": 0.8492515852978063, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6582, + "eval_samples_per_second": 15.867, + "eval_steps_per_second": 1.985, + "step": 1780 + }, + { + "entropy": 0.32619857545942066, + "epoch": 4.478206724782067, + "grad_norm": 0.7210651636123657, + "learning_rate": 0.00015275749542482337, + "loss": 0.24651215076446534, + "mean_token_accuracy": 0.9177676141262054, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.3947690814560236, + "eval_loss": 0.6065912246704102, + "eval_mean_token_accuracy": 0.8502957744653835, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.5959, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.986, + "step": 1800 + }, + { + "entropy": 0.3193941755220294, + "epoch": 4.5280199252802, + "grad_norm": 0.8281906843185425, + "learning_rate": 0.0001509111761786888, + "loss": 0.23936262130737304, + "mean_token_accuracy": 0.9201708927750587, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38704028864239537, + "eval_loss": 0.6006569266319275, + "eval_mean_token_accuracy": 0.8502406720505205, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.8059, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1820 + }, + { + "entropy": 0.3164879363030195, + "epoch": 4.577833125778331, + "grad_norm": 0.7892968654632568, + "learning_rate": 0.00014905346557909867, + "loss": 0.24541733264923096, + "mean_token_accuracy": 0.9175932116806507, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.38861122120951497, + "eval_loss": 0.6115967631340027, + "eval_mean_token_accuracy": 0.849471275196519, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.2946, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1840 + }, + { + "entropy": 0.3051785985007882, + "epoch": 4.627646326276463, + "grad_norm": 0.8109654188156128, + "learning_rate": 0.0001471849238862319, + "loss": 0.23433220386505127, + "mean_token_accuracy": 0.9206570319831371, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.37162452295076015, + "eval_loss": 0.6184061765670776, + "eval_mean_token_accuracy": 0.8501173268223918, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.6865, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1860 + }, + { + "entropy": 0.3168198253959417, + "epoch": 4.677459526774595, + "grad_norm": 0.9512342214584351, + "learning_rate": 0.0001453061146267775, + "loss": 0.23832404613494873, + "mean_token_accuracy": 0.9197044663131237, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3845940856912801, + "eval_loss": 0.606762707233429, + "eval_mean_token_accuracy": 0.8504838194957999, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.5175, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 1880 + }, + { + "entropy": 0.30791807882487776, + "epoch": 4.7272727272727275, + "grad_norm": 0.8123113512992859, + "learning_rate": 0.00014341760442398248, + "loss": 0.2395785331726074, + "mean_token_accuracy": 0.918928150832653, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.39762327222283494, + "eval_loss": 0.5994202494621277, + "eval_mean_token_accuracy": 0.8509274201337681, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.2873, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.993, + "step": 1900 + }, + { + "entropy": 0.3021434534341097, + "epoch": 4.777085927770859, + "grad_norm": 0.731787383556366, + "learning_rate": 0.000141519962826766, + "loss": 0.23494718074798585, + "mean_token_accuracy": 0.9201403826475143, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.3827026732439219, + "eval_loss": 0.5995895862579346, + "eval_mean_token_accuracy": 0.851468373523202, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.3006, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 1920 + }, + { + "entropy": 0.31626159623265265, + "epoch": 4.826899128268991, + "grad_norm": 0.8848487138748169, + "learning_rate": 0.00013961376213795132, + "loss": 0.2439030647277832, + "mean_token_accuracy": 0.9196575872600079, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.388698436839636, + "eval_loss": 0.6000174283981323, + "eval_mean_token_accuracy": 0.8518068187458571, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.8979, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.979, + "step": 1940 + }, + { + "entropy": 0.30520407035946845, + "epoch": 4.876712328767123, + "grad_norm": 0.8532460927963257, + "learning_rate": 0.00013769957724166695, + "loss": 0.23458616733551024, + "mean_token_accuracy": 0.9221912942826748, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.38777847102908203, + "eval_loss": 0.6004981398582458, + "eval_mean_token_accuracy": 0.8516481768253238, + "eval_num_tokens": 4578167.0, + "eval_runtime": 87.0777, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.975, + "step": 1960 + }, + { + "entropy": 0.3226448342204094, + "epoch": 4.926525529265255, + "grad_norm": 0.6945561766624451, + "learning_rate": 0.0001357779854299694, + "loss": 0.24048397541046143, + "mean_token_accuracy": 0.9195300146937371, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.38581624263247777, + "eval_loss": 0.6029234528541565, + "eval_mean_token_accuracy": 0.8514213260523108, + "eval_num_tokens": 4622316.0, + "eval_runtime": 85.8729, + "eval_samples_per_second": 16.012, + "eval_steps_per_second": 2.003, + "step": 1980 + }, + { + "entropy": 0.3051655298098922, + "epoch": 4.976338729763388, + "grad_norm": 0.7976452708244324, + "learning_rate": 0.00013384956622874001, + "loss": 0.23584742546081544, + "mean_token_accuracy": 0.9216851457953453, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.37913159246361533, + "eval_loss": 0.6057604551315308, + "eval_mean_token_accuracy": 0.8525801203971686, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.1145, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 2000 + }, + { + "entropy": 0.27438195240803254, + "epoch": 5.024906600249066, + "grad_norm": 0.6729586124420166, + "learning_rate": 0.0001319149012229075, + "loss": 0.19775952100753785, + "mean_token_accuracy": 0.9339428559327737, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.3448961910813354, + "eval_loss": 0.6750120520591736, + "eval_mean_token_accuracy": 0.8487970232963562, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.1169, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 2020 + }, + { + "entropy": 0.21423916313797237, + "epoch": 5.074719800747198, + "grad_norm": 0.6934391856193542, + "learning_rate": 0.00012997457388105022, + "loss": 0.1439570426940918, + "mean_token_accuracy": 0.9528236843645572, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.3570949243771475, + "eval_loss": 0.6465504169464111, + "eval_mean_token_accuracy": 0.8490785547467166, + "eval_num_tokens": 4763269.0, + "eval_runtime": 85.9574, + "eval_samples_per_second": 15.996, + "eval_steps_per_second": 2.001, + "step": 2040 + }, + { + "entropy": 0.20838565267622472, + "epoch": 5.12453300124533, + "grad_norm": 0.7286986112594604, + "learning_rate": 0.00012802916937942972, + "loss": 0.14467307329177856, + "mean_token_accuracy": 0.950994835793972, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.3452463157821533, + "eval_loss": 0.6705958843231201, + "eval_mean_token_accuracy": 0.8490352796953778, + "eval_num_tokens": 4809047.0, + "eval_runtime": 86.228, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 2060 + }, + { + "entropy": 0.20453082229942082, + "epoch": 5.174346201743462, + "grad_norm": 0.7515555620193481, + "learning_rate": 0.00012607927442550974, + "loss": 0.13732000589370727, + "mean_token_accuracy": 0.9537357829511166, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.32431264914745506, + "eval_loss": 0.6743043065071106, + "eval_mean_token_accuracy": 0.8504878629085629, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.5948, + "eval_samples_per_second": 15.879, + "eval_steps_per_second": 1.986, + "step": 2080 + }, + { + "entropy": 0.21812320686876774, + "epoch": 5.224159402241594, + "grad_norm": 0.9093465209007263, + "learning_rate": 0.0001241254770810132, + "loss": 0.14311420917510986, + "mean_token_accuracy": 0.9514068141579628, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.33086285835435225, + "eval_loss": 0.6676449179649353, + "eval_mean_token_accuracy": 0.8505287662495015, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 2100 + }, + { + "entropy": 0.2180163251236081, + "epoch": 5.273972602739726, + "grad_norm": 0.6703007221221924, + "learning_rate": 0.00012216836658457075, + "loss": 0.14803968667984008, + "mean_token_accuracy": 0.9521303348243236, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.33162341708707255, + "eval_loss": 0.6658875942230225, + "eval_mean_token_accuracy": 0.8500757605530495, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.6296, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 2120 + }, + { + "entropy": 0.22511130161583423, + "epoch": 5.323785803237858, + "grad_norm": 0.8078880906105042, + "learning_rate": 0.00012020853317401455, + "loss": 0.15228408575057983, + "mean_token_accuracy": 0.947144789993763, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3354601170434508, + "eval_loss": 0.6677829623222351, + "eval_mean_token_accuracy": 0.8482600024273229, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.4689, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.989, + "step": 2140 + }, + { + "entropy": 0.2244176059961319, + "epoch": 5.37359900373599, + "grad_norm": 0.9636075496673584, + "learning_rate": 0.00011824656790837037, + "loss": 0.15260883569717407, + "mean_token_accuracy": 0.9471467643976211, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.3381616926297199, + "eval_loss": 0.6694412231445312, + "eval_mean_token_accuracy": 0.8482369603805764, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.4147, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 2160 + }, + { + "entropy": 0.22982364390045404, + "epoch": 5.423412204234122, + "grad_norm": 0.775401771068573, + "learning_rate": 0.00011628306248960262, + "loss": 0.15140302181243898, + "mean_token_accuracy": 0.9492553934454918, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.3305150235808173, + "eval_loss": 0.6717822551727295, + "eval_mean_token_accuracy": 0.8489849723355715, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.4728, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.989, + "step": 2180 + }, + { + "entropy": 0.21448935717344284, + "epoch": 5.473225404732254, + "grad_norm": 0.6575281023979187, + "learning_rate": 0.00011431860908416465, + "loss": 0.1452319622039795, + "mean_token_accuracy": 0.9505287684500218, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3488145174328671, + "eval_loss": 0.6612305641174316, + "eval_mean_token_accuracy": 0.8492907808963642, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6927, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 2200 + }, + { + "entropy": 0.23091202937066554, + "epoch": 5.523038605230386, + "grad_norm": 0.8909686207771301, + "learning_rate": 0.00011235380014440985, + "loss": 0.15150139331817628, + "mean_token_accuracy": 0.9497875183820724, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.3268539015810157, + "eval_loss": 0.6667542457580566, + "eval_mean_token_accuracy": 0.8499062903398691, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.4644, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 2220 + }, + { + "entropy": 0.2227974807843566, + "epoch": 5.572851805728518, + "grad_norm": 0.6180275082588196, + "learning_rate": 0.0001103892282299158, + "loss": 0.1491069197654724, + "mean_token_accuracy": 0.9488144010305405, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3346347655494546, + "eval_loss": 0.6665948629379272, + "eval_mean_token_accuracy": 0.8499961893918903, + "eval_num_tokens": 5226864.0, + "eval_runtime": 87.0548, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.976, + "step": 2240 + }, + { + "entropy": 0.21368421968072654, + "epoch": 5.62266500622665, + "grad_norm": 0.6004369258880615, + "learning_rate": 0.00010842548582877651, + "loss": 0.14485255479812623, + "mean_token_accuracy": 0.9502056457102299, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.32753298804163933, + "eval_loss": 0.6680151224136353, + "eval_mean_token_accuracy": 0.8515451086121936, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.8524, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.98, + "step": 2260 + }, + { + "entropy": 0.2103635374456644, + "epoch": 5.672478206724782, + "grad_norm": 0.699174702167511, + "learning_rate": 0.00010646316517891613, + "loss": 0.14297772645950318, + "mean_token_accuracy": 0.9512537539005279, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.32966585959806, + "eval_loss": 0.675578773021698, + "eval_mean_token_accuracy": 0.8509623023659684, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.4518, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.99, + "step": 2280 + }, + { + "entropy": 0.22516900151968003, + "epoch": 5.722291407222914, + "grad_norm": 0.6637354493141174, + "learning_rate": 0.00010450285808947797, + "loss": 0.15202572345733642, + "mean_token_accuracy": 0.9482452072203159, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3369456917740578, + "eval_loss": 0.6697061061859131, + "eval_mean_token_accuracy": 0.848603522361711, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.6371, + "eval_samples_per_second": 15.871, + "eval_steps_per_second": 1.985, + "step": 2300 + }, + { + "entropy": 0.21841065725311637, + "epoch": 5.772104607721046, + "grad_norm": 0.7940268516540527, + "learning_rate": 0.00010254515576234297, + "loss": 0.14710167646408082, + "mean_token_accuracy": 0.9493498183786869, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3237486180177955, + "eval_loss": 0.6779657602310181, + "eval_mean_token_accuracy": 0.8500715313955794, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.1826, + "eval_samples_per_second": 15.954, + "eval_steps_per_second": 1.996, + "step": 2320 + }, + { + "entropy": 0.22146204356104135, + "epoch": 5.821917808219178, + "grad_norm": 0.9234833121299744, + "learning_rate": 0.00010059064861383132, + "loss": 0.14720046520233154, + "mean_token_accuracy": 0.9493872679769992, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.32365207564692167, + "eval_loss": 0.6704005002975464, + "eval_mean_token_accuracy": 0.8507985760306203, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.5494, + "eval_samples_per_second": 15.887, + "eval_steps_per_second": 1.987, + "step": 2340 + }, + { + "entropy": 0.20934011954814197, + "epoch": 5.87173100871731, + "grad_norm": 0.5547503232955933, + "learning_rate": 9.863992609664084e-05, + "loss": 0.1464867353439331, + "mean_token_accuracy": 0.9503875687718392, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.3330401429083458, + "eval_loss": 0.6659091114997864, + "eval_mean_token_accuracy": 0.8504848906467127, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.5855, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 2360 + }, + { + "entropy": 0.21678635366261007, + "epoch": 5.921544209215442, + "grad_norm": 0.570612907409668, + "learning_rate": 9.669357652207635e-05, + "loss": 0.14821385145187377, + "mean_token_accuracy": 0.9503940217196941, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3322022325077722, + "eval_loss": 0.6722489595413208, + "eval_mean_token_accuracy": 0.8489979422369669, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.2986, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 2380 + }, + { + "entropy": 0.20932920072227718, + "epoch": 5.971357409713574, + "grad_norm": 0.7879557609558105, + "learning_rate": 9.475218688262262e-05, + "loss": 0.14675841331481934, + "mean_token_accuracy": 0.9507176131010056, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.3199348642902319, + "eval_loss": 0.6698136329650879, + "eval_mean_token_accuracy": 0.8514142130003419, + "eval_num_tokens": 5605400.0, + "eval_runtime": 85.8995, + "eval_samples_per_second": 16.007, + "eval_steps_per_second": 2.002, + "step": 2400 + }, + { + "entropy": 0.21032143919131693, + "epoch": 6.019925280199253, + "grad_norm": 0.5823076367378235, + "learning_rate": 9.281634267491569e-05, + "loss": 0.13322267532348633, + "mean_token_accuracy": 0.9550939072401096, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.30206270117399303, + "eval_loss": 0.7093168497085571, + "eval_mean_token_accuracy": 0.8500627639681794, + "eval_num_tokens": 5648968.0, + "eval_runtime": 85.8128, + "eval_samples_per_second": 16.023, + "eval_steps_per_second": 2.004, + "step": 2420 + }, + { + "entropy": 0.1534628233872354, + "epoch": 6.069738480697385, + "grad_norm": 0.710133969783783, + "learning_rate": 9.088662772316508e-05, + "loss": 0.09078952670097351, + "mean_token_accuracy": 0.9678447999060154, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.28208133101809857, + "eval_loss": 0.7636417150497437, + "eval_mean_token_accuracy": 0.8494061477655588, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9724, + "eval_samples_per_second": 15.994, + "eval_steps_per_second": 2.001, + "step": 2440 + }, + { + "entropy": 0.16151462448760867, + "epoch": 6.119551681195516, + "grad_norm": 0.5793812274932861, + "learning_rate": 8.896362400308028e-05, + "loss": 0.09545697569847107, + "mean_token_accuracy": 0.9671573750674725, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.2833245605403601, + "eval_loss": 0.7402405738830566, + "eval_mean_token_accuracy": 0.8503523728875226, + "eval_num_tokens": 5745090.0, + "eval_runtime": 85.5461, + "eval_samples_per_second": 16.073, + "eval_steps_per_second": 2.011, + "step": 2460 + }, + { + "entropy": 0.15203177919611335, + "epoch": 6.169364881693649, + "grad_norm": 0.4251123368740082, + "learning_rate": 8.704791146635483e-05, + "loss": 0.09420782327651978, + "mean_token_accuracy": 0.9677386932075024, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.28572545962971313, + "eval_loss": 0.735416829586029, + "eval_mean_token_accuracy": 0.8487084663884584, + "eval_num_tokens": 5790333.0, + "eval_runtime": 85.4801, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.012, + "step": 2480 + }, + { + "entropy": 0.15587336672469973, + "epoch": 6.219178082191781, + "grad_norm": 0.4357028007507324, + "learning_rate": 8.514006786576085e-05, + "loss": 0.09429320096969604, + "mean_token_accuracy": 0.9682952925562859, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.2859006894882335, + "eval_loss": 0.7347224950790405, + "eval_mean_token_accuracy": 0.8501905518215757, + "eval_num_tokens": 5837321.0, + "eval_runtime": 85.7578, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.006, + "step": 2500 + }, + { + "entropy": 0.15765639198943973, + "epoch": 6.268991282689913, + "grad_norm": 0.47331130504608154, + "learning_rate": 8.324066858090663e-05, + "loss": 0.09571113586425781, + "mean_token_accuracy": 0.9683481335639954, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.29231513846059176, + "eval_loss": 0.7392512559890747, + "eval_mean_token_accuracy": 0.8486633983462356, + "eval_num_tokens": 5884398.0, + "eval_runtime": 85.7846, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.005, + "step": 2520 + }, + { + "entropy": 0.16176860257983208, + "epoch": 6.318804483188045, + "grad_norm": 0.6142018437385559, + "learning_rate": 8.135028644470992e-05, + "loss": 0.09486144185066223, + "mean_token_accuracy": 0.9682316601276397, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.2851274753379267, + "eval_loss": 0.7520816922187805, + "eval_mean_token_accuracy": 0.8501113649717597, + "eval_num_tokens": 5929876.0, + "eval_runtime": 85.9425, + "eval_samples_per_second": 15.999, + "eval_steps_per_second": 2.001, + "step": 2540 + }, + { + "entropy": 0.15404034564271568, + "epoch": 6.3686176836861765, + "grad_norm": 0.6051287651062012, + "learning_rate": 7.946949157063964e-05, + "loss": 0.09280472993850708, + "mean_token_accuracy": 0.9684635892510414, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28802703563557114, + "eval_loss": 0.7439162135124207, + "eval_mean_token_accuracy": 0.8499851770872293, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.0703, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.998, + "step": 2560 + }, + { + "entropy": 0.15343588953837753, + "epoch": 6.418430884184309, + "grad_norm": 0.4823743402957916, + "learning_rate": 7.759885118077701e-05, + "loss": 0.09000591039657593, + "mean_token_accuracy": 0.9699928767979145, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2795634938533916, + "eval_loss": 0.7647850513458252, + "eval_mean_token_accuracy": 0.8503464397995971, + "eval_num_tokens": 6025380.0, + "eval_runtime": 85.8886, + "eval_samples_per_second": 16.009, + "eval_steps_per_second": 2.003, + "step": 2580 + }, + { + "entropy": 0.15740026142448188, + "epoch": 6.468244084682441, + "grad_norm": 0.5082696676254272, + "learning_rate": 7.57389294347494e-05, + "loss": 0.09191849827766418, + "mean_token_accuracy": 0.9692809768021107, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2913342311458532, + "eval_loss": 0.7518694996833801, + "eval_mean_token_accuracy": 0.8483168302580367, + "eval_num_tokens": 6073349.0, + "eval_runtime": 85.5761, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.01, + "step": 2600 + }, + { + "entropy": 0.15922069251537324, + "epoch": 6.518057285180573, + "grad_norm": 0.3995199501514435, + "learning_rate": 7.389028725958736e-05, + "loss": 0.09584367871284485, + "mean_token_accuracy": 0.9685114495456218, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.2863075934177221, + "eval_loss": 0.7539381384849548, + "eval_mean_token_accuracy": 0.8507507083027862, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.112, + "eval_samples_per_second": 15.968, + "eval_steps_per_second": 1.997, + "step": 2620 + }, + { + "entropy": 0.16197575423866512, + "epoch": 6.567870485678705, + "grad_norm": 0.534295380115509, + "learning_rate": 7.205348218055678e-05, + "loss": 0.0961170256137848, + "mean_token_accuracy": 0.9674530044198036, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.29021967315050057, + "eval_loss": 0.751198947429657, + "eval_mean_token_accuracy": 0.8509796344956686, + "eval_num_tokens": 6165523.0, + "eval_runtime": 85.7958, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.005, + "step": 2640 + }, + { + "entropy": 0.15261746793985367, + "epoch": 6.617683686176837, + "grad_norm": 0.5391237139701843, + "learning_rate": 7.022906815301673e-05, + "loss": 0.0926026999950409, + "mean_token_accuracy": 0.9695659473538398, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.29128045216202736, + "eval_loss": 0.7450292110443115, + "eval_mean_token_accuracy": 0.8498771443616512, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.3963, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 2660 + }, + { + "entropy": 0.16164180357009172, + "epoch": 6.667496886674969, + "grad_norm": 0.5767946243286133, + "learning_rate": 6.841759539535419e-05, + "loss": 0.09291981458663941, + "mean_token_accuracy": 0.9687136687338352, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2897637223088464, + "eval_loss": 0.7503410577774048, + "eval_mean_token_accuracy": 0.8503315164599308, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.0653, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.998, + "step": 2680 + }, + { + "entropy": 0.17062523355707526, + "epoch": 6.717310087173101, + "grad_norm": 0.4974168539047241, + "learning_rate": 6.661961022304563e-05, + "loss": 0.09713236689567566, + "mean_token_accuracy": 0.9661971725523472, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2765843396963075, + "eval_loss": 0.7604002356529236, + "eval_mean_token_accuracy": 0.8521115277395692, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.1676, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 2700 + }, + { + "entropy": 0.17544092936441302, + "epoch": 6.767123287671232, + "grad_norm": 0.5523537993431091, + "learning_rate": 6.483565488389582e-05, + "loss": 0.09709116220474243, + "mean_token_accuracy": 0.9650957375764847, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.27939334659035814, + "eval_loss": 0.7534670829772949, + "eval_mean_token_accuracy": 0.851230604010959, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.2913, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 2720 + }, + { + "entropy": 0.15991022661328316, + "epoch": 6.816936488169365, + "grad_norm": 0.478551983833313, + "learning_rate": 6.306626739450311e-05, + "loss": 0.09564646482467651, + "mean_token_accuracy": 0.9679084822535515, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.27878295491601146, + "eval_loss": 0.7519959211349487, + "eval_mean_token_accuracy": 0.8510654949864676, + "eval_num_tokens": 6397720.0, + "eval_runtime": 85.9109, + "eval_samples_per_second": 16.005, + "eval_steps_per_second": 2.002, + "step": 2740 + }, + { + "entropy": 0.16824879590421915, + "epoch": 6.866749688667497, + "grad_norm": 0.6681098937988281, + "learning_rate": 6.131198137800108e-05, + "loss": 0.0962279736995697, + "mean_token_accuracy": 0.966830012947321, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.2834690434121808, + "eval_loss": 0.751922070980072, + "eval_mean_token_accuracy": 0.8521237577809844, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.3618, + "eval_samples_per_second": 15.921, + "eval_steps_per_second": 1.992, + "step": 2760 + }, + { + "entropy": 0.1518704930320382, + "epoch": 6.916562889165629, + "grad_norm": 0.5201290249824524, + "learning_rate": 5.957332590312513e-05, + "loss": 0.09010660648345947, + "mean_token_accuracy": 0.9693463340401649, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.28485129617674404, + "eval_loss": 0.7452457547187805, + "eval_mean_token_accuracy": 0.8512036796919135, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.4524, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.99, + "step": 2780 + }, + { + "entropy": 0.15512610590085388, + "epoch": 6.966376089663761, + "grad_norm": 0.42802050709724426, + "learning_rate": 5.785082532465233e-05, + "loss": 0.09320432543754578, + "mean_token_accuracy": 0.9686134628951549, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.27554594526110693, + "eval_loss": 0.7644653916358948, + "eval_mean_token_accuracy": 0.8513738523389018, + "eval_num_tokens": 6540175.0, + "eval_runtime": 85.7609, + "eval_samples_per_second": 16.033, + "eval_steps_per_second": 2.006, + "step": 2800 + }, + { + "entropy": 0.17524497526196334, + "epoch": 7.01494396014944, + "grad_norm": 0.3330269157886505, + "learning_rate": 5.6144999125263545e-05, + "loss": 0.0895616888999939, + "mean_token_accuracy": 0.9682766932707566, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.2735865569218647, + "eval_loss": 0.768479585647583, + "eval_mean_token_accuracy": 0.8503459383581959, + "eval_num_tokens": 6583767.0, + "eval_runtime": 85.7162, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.007, + "step": 2820 + }, + { + "entropy": 0.1403565663844347, + "epoch": 7.064757160647572, + "grad_norm": 0.35613498091697693, + "learning_rate": 5.4456361758874235e-05, + "loss": 0.07551313638687134, + "mean_token_accuracy": 0.9739301167428493, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.25941789089593775, + "eval_loss": 0.8209511637687683, + "eval_mean_token_accuracy": 0.8505055855873019, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.0943, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 2840 + }, + { + "entropy": 0.13500106502324344, + "epoch": 7.114570361145703, + "grad_norm": 0.34418627619743347, + "learning_rate": 5.2785422495482234e-05, + "loss": 0.07293946146965027, + "mean_token_accuracy": 0.9747208289802074, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.26482899772912954, + "eval_loss": 0.798904538154602, + "eval_mean_token_accuracy": 0.8511530233677044, + "eval_num_tokens": 6672946.0, + "eval_runtime": 85.7915, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.005, + "step": 2860 + }, + { + "entropy": 0.13127502552233636, + "epoch": 7.164383561643835, + "grad_norm": 0.4638441503047943, + "learning_rate": 5.113268526757892e-05, + "loss": 0.07121461629867554, + "mean_token_accuracy": 0.9756786689162255, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2645381211714689, + "eval_loss": 0.809101939201355, + "eval_mean_token_accuracy": 0.8514727898115335, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.84, + "eval_samples_per_second": 16.018, + "eval_steps_per_second": 2.004, + "step": 2880 + }, + { + "entropy": 0.1331390908919275, + "epoch": 7.214196762141968, + "grad_norm": 0.40206775069236755, + "learning_rate": 4.949864851817007e-05, + "loss": 0.07188264131546021, + "mean_token_accuracy": 0.9755406074225903, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.26244733283339544, + "eval_loss": 0.8143188953399658, + "eval_mean_token_accuracy": 0.8514358189909957, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.8546, + "eval_samples_per_second": 16.015, + "eval_steps_per_second": 2.003, + "step": 2900 + }, + { + "entropy": 0.13647331558167936, + "epoch": 7.2640099626401, + "grad_norm": 0.26405787467956543, + "learning_rate": 4.788380505045224e-05, + "loss": 0.07412450313568116, + "mean_token_accuracy": 0.9744274213910102, + "num_tokens": 6809678.0, + "step": 2920 + }, + { + "epoch": 7.2640099626401, + "eval_entropy": 0.2626111418182074, + "eval_loss": 0.8111525177955627, + "eval_mean_token_accuracy": 0.8512121695418691, + "eval_num_tokens": 6809678.0, + "eval_runtime": 85.9626, + "eval_samples_per_second": 15.995, + "eval_steps_per_second": 2.001, + "step": 2920 + }, + { + "entropy": 0.12644002586603165, + "epoch": 7.313823163138232, + "grad_norm": 0.27514681220054626, + "learning_rate": 4.6288641879189884e-05, + "loss": 0.06807711124420165, + "mean_token_accuracy": 0.9760703906416893, + "num_tokens": 6860750.0, + "step": 2940 + }, + { + "epoch": 7.313823163138232, + "eval_entropy": 0.26096762734097106, + "eval_loss": 0.8184595108032227, + "eval_mean_token_accuracy": 0.8501476153384807, + "eval_num_tokens": 6860750.0, + "eval_runtime": 85.9521, + "eval_samples_per_second": 15.997, + "eval_steps_per_second": 2.001, + "step": 2940 + }, + { + "entropy": 0.13920630998909472, + "epoch": 7.363636363636363, + "grad_norm": 0.23584705591201782, + "learning_rate": 4.4713640083838604e-05, + "loss": 0.07301607131958007, + "mean_token_accuracy": 0.9745715200901032, + "num_tokens": 6907092.0, + "step": 2960 + }, + { + "epoch": 7.363636363636363, + "eval_entropy": 0.2612536767021168, + "eval_loss": 0.8116245269775391, + "eval_mean_token_accuracy": 0.8510967350976412, + "eval_num_tokens": 6907092.0, + "eval_runtime": 85.6373, + "eval_samples_per_second": 16.056, + "eval_steps_per_second": 2.008, + "step": 2960 + }, + { + "entropy": 0.1349492883309722, + "epoch": 7.4134495641344955, + "grad_norm": 0.24552719295024872, + "learning_rate": 4.315927466345791e-05, + "loss": 0.07397544980049134, + "mean_token_accuracy": 0.9745095103979111, + "num_tokens": 6952700.0, + "step": 2980 + }, + { + "epoch": 7.4134495641344955, + "eval_entropy": 0.25796533306670744, + "eval_loss": 0.8266491293907166, + "eval_mean_token_accuracy": 0.8511653857868772, + "eval_num_tokens": 6952700.0, + "eval_runtime": 85.7462, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.006, + "step": 2980 + }, + { + "entropy": 0.14479175000451505, + "epoch": 7.463262764632628, + "grad_norm": 0.2846072018146515, + "learning_rate": 4.162601439345814e-05, + "loss": 0.07544798254966736, + "mean_token_accuracy": 0.9727819666266442, + "num_tokens": 6996430.0, + "step": 3000 + }, + { + "epoch": 7.463262764632628, + "eval_entropy": 0.2584348309698493, + "eval_loss": 0.8253348469734192, + "eval_mean_token_accuracy": 0.8511569815319638, + "eval_num_tokens": 6996430.0, + "eval_runtime": 86.2984, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 3000 + }, + { + "entropy": 0.14114196319133043, + "epoch": 7.51307596513076, + "grad_norm": 0.407966285943985, + "learning_rate": 4.011432168422419e-05, + "loss": 0.0736398994922638, + "mean_token_accuracy": 0.9741654269397259, + "num_tokens": 7042038.0, + "step": 3020 + }, + { + "epoch": 7.51307596513076, + "eval_entropy": 0.25232676260693127, + "eval_loss": 0.8296052813529968, + "eval_mean_token_accuracy": 0.8523298349491385, + "eval_num_tokens": 7042038.0, + "eval_runtime": 85.8445, + "eval_samples_per_second": 16.017, + "eval_steps_per_second": 2.004, + "step": 3020 + }, + { + "entropy": 0.1353456223383546, + "epoch": 7.562889165628892, + "grad_norm": 0.2712634801864624, + "learning_rate": 3.8624652441658684e-05, + "loss": 0.07362412214279175, + "mean_token_accuracy": 0.9747945807874203, + "num_tokens": 7089390.0, + "step": 3040 + }, + { + "epoch": 7.562889165628892, + "eval_entropy": 0.2579477243991785, + "eval_loss": 0.8274564743041992, + "eval_mean_token_accuracy": 0.8517705212498821, + "eval_num_tokens": 7089390.0, + "eval_runtime": 85.8222, + "eval_samples_per_second": 16.022, + "eval_steps_per_second": 2.004, + "step": 3040 + }, + { + "entropy": 0.1296080862637609, + "epoch": 7.6127023661270234, + "grad_norm": 0.2371893972158432, + "learning_rate": 3.715745592968707e-05, + "loss": 0.06971035599708557, + "mean_token_accuracy": 0.9759043246507645, + "num_tokens": 7138002.0, + "step": 3060 + }, + { + "epoch": 7.6127023661270234, + "eval_entropy": 0.25391967083479083, + "eval_loss": 0.8197130560874939, + "eval_mean_token_accuracy": 0.8522267875283264, + "eval_num_tokens": 7138002.0, + "eval_runtime": 85.8796, + "eval_samples_per_second": 16.011, + "eval_steps_per_second": 2.003, + "step": 3060 + }, + { + "entropy": 0.1311203008517623, + "epoch": 7.662515566625156, + "grad_norm": 0.22499267756938934, + "learning_rate": 3.5713174634765967e-05, + "loss": 0.07176244258880615, + "mean_token_accuracy": 0.9754939571022987, + "num_tokens": 7185520.0, + "step": 3080 + }, + { + "epoch": 7.662515566625156, + "eval_entropy": 0.2526215241225653, + "eval_loss": 0.8265154361724854, + "eval_mean_token_accuracy": 0.8519952584837758, + "eval_num_tokens": 7185520.0, + "eval_runtime": 85.8746, + "eval_samples_per_second": 16.012, + "eval_steps_per_second": 2.003, + "step": 3080 + }, + { + "entropy": 0.13420484317466616, + "epoch": 7.712328767123288, + "grad_norm": 0.2398064285516739, + "learning_rate": 3.4292244132434866e-05, + "loss": 0.07559212446212768, + "mean_token_accuracy": 0.9743142127990723, + "num_tokens": 7232170.0, + "step": 3100 + }, + { + "epoch": 7.712328767123288, + "eval_entropy": 0.2484562756537005, + "eval_loss": 0.8312150239944458, + "eval_mean_token_accuracy": 0.8528405119513356, + "eval_num_tokens": 7232170.0, + "eval_runtime": 85.7896, + "eval_samples_per_second": 16.028, + "eval_steps_per_second": 2.005, + "step": 3100 + }, + { + "entropy": 0.11965563679113984, + "epoch": 7.76214196762142, + "grad_norm": 0.3408384919166565, + "learning_rate": 3.2895092955952746e-05, + "loss": 0.0661750853061676, + "mean_token_accuracy": 0.9776600524783134, + "num_tokens": 7282846.0, + "step": 3120 + }, + { + "epoch": 7.76214196762142, + "eval_entropy": 0.2522421533804993, + "eval_loss": 0.8327009677886963, + "eval_mean_token_accuracy": 0.8524222023958383, + "eval_num_tokens": 7282846.0, + "eval_runtime": 86.1769, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 1.996, + "step": 3120 + }, + { + "entropy": 0.13388084415346385, + "epoch": 7.811955168119551, + "grad_norm": 0.35418516397476196, + "learning_rate": 3.152214246705829e-05, + "loss": 0.07149899601936341, + "mean_token_accuracy": 0.9747635535895824, + "num_tokens": 7331518.0, + "step": 3140 + }, + { + "epoch": 7.811955168119551, + "eval_entropy": 0.25038352296795957, + "eval_loss": 0.836457371711731, + "eval_mean_token_accuracy": 0.8526130665180295, + "eval_num_tokens": 7331518.0, + "eval_runtime": 85.6099, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.009, + "step": 3140 + }, + { + "entropy": 0.13530643959529698, + "epoch": 7.861768368617684, + "grad_norm": 0.38060539960861206, + "learning_rate": 3.017380672889291e-05, + "loss": 0.07116585969924927, + "mean_token_accuracy": 0.973284512758255, + "num_tokens": 7379056.0, + "step": 3160 + }, + { + "epoch": 7.861768368617684, + "eval_entropy": 0.255092611319797, + "eval_loss": 0.8314701914787292, + "eval_mean_token_accuracy": 0.8520913099826768, + "eval_num_tokens": 7379056.0, + "eval_runtime": 85.877, + "eval_samples_per_second": 16.011, + "eval_steps_per_second": 2.003, + "step": 3160 + }, + { + "entropy": 0.13383390177041293, + "epoch": 7.911581569115816, + "grad_norm": 0.3827536106109619, + "learning_rate": 2.8850492381124808e-05, + "loss": 0.07305437326431274, + "mean_token_accuracy": 0.9750778004527092, + "num_tokens": 7424770.0, + "step": 3180 + }, + { + "epoch": 7.911581569115816, + "eval_entropy": 0.25416371157003004, + "eval_loss": 0.8206402063369751, + "eval_mean_token_accuracy": 0.852779901651449, + "eval_num_tokens": 7424770.0, + "eval_runtime": 86.1015, + "eval_samples_per_second": 15.97, + "eval_steps_per_second": 1.998, + "step": 3180 + }, + { + "entropy": 0.1395680439658463, + "epoch": 7.961394769613948, + "grad_norm": 0.3809775412082672, + "learning_rate": 2.7552598517312256e-05, + "loss": 0.07236042022705078, + "mean_token_accuracy": 0.9731538116931915, + "num_tokens": 7470804.0, + "step": 3200 + }, + { + "epoch": 7.961394769613948, + "eval_entropy": 0.25528111975899964, + "eval_loss": 0.8230037093162537, + "eval_mean_token_accuracy": 0.8526452603035195, + "eval_num_tokens": 7470804.0, + "eval_runtime": 85.7895, + "eval_samples_per_second": 16.028, + "eval_steps_per_second": 2.005, + "step": 3200 + }, + { + "entropy": 0.12193699864049752, + "epoch": 8.009962640099626, + "grad_norm": 0.11854425817728043, + "learning_rate": 2.6280516564542205e-05, + "loss": 0.06617764234542847, + "mean_token_accuracy": 0.977179691577569, + "num_tokens": 7518110.0, + "step": 3220 + }, + { + "epoch": 8.009962640099626, + "eval_entropy": 0.25100527677771656, + "eval_loss": 0.8393343687057495, + "eval_mean_token_accuracy": 0.8522553132023922, + "eval_num_tokens": 7518110.0, + "eval_runtime": 85.8837, + "eval_samples_per_second": 16.01, + "eval_steps_per_second": 2.003, + "step": 3220 + }, + { + "entropy": 0.12788885813206435, + "epoch": 8.059775840597759, + "grad_norm": 0.16094881296157837, + "learning_rate": 2.50346301653812e-05, + "loss": 0.06274186968803405, + "mean_token_accuracy": 0.9766994707286358, + "num_tokens": 7565539.0, + "step": 3240 + }, + { + "epoch": 8.059775840597759, + "eval_entropy": 0.24409458682287571, + "eval_loss": 0.874617338180542, + "eval_mean_token_accuracy": 0.8521041180505309, + "eval_num_tokens": 7565539.0, + "eval_runtime": 86.2656, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 3240 + }, + { + "entropy": 0.12464155335910618, + "epoch": 8.10958904109589, + "grad_norm": 0.16893954575061798, + "learning_rate": 2.381531506217437e-05, + "loss": 0.06093020439147949, + "mean_token_accuracy": 0.9776258453726768, + "num_tokens": 7612578.0, + "step": 3260 + }, + { + "epoch": 8.10958904109589, + "eval_entropy": 0.24396493017326953, + "eval_loss": 0.891161322593689, + "eval_mean_token_accuracy": 0.8515338024427724, + "eval_num_tokens": 7612578.0, + "eval_runtime": 85.9061, + "eval_samples_per_second": 16.006, + "eval_steps_per_second": 2.002, + "step": 3260 + }, + { + "entropy": 0.12345920228399336, + "epoch": 8.159402241594023, + "grad_norm": 0.14332273602485657, + "learning_rate": 2.262293898372616e-05, + "loss": 0.061289966106414795, + "mean_token_accuracy": 0.9762230902910233, + "num_tokens": 7660157.0, + "step": 3280 + }, + { + "epoch": 8.159402241594023, + "eval_entropy": 0.2481445314059424, + "eval_loss": 0.8922848105430603, + "eval_mean_token_accuracy": 0.8514944855556932, + "eval_num_tokens": 7660157.0, + "eval_runtime": 85.5201, + "eval_samples_per_second": 16.078, + "eval_steps_per_second": 2.011, + "step": 3280 + }, + { + "entropy": 0.12298110066913068, + "epoch": 8.209215442092155, + "grad_norm": 0.21848882734775543, + "learning_rate": 2.1457861534398633e-05, + "loss": 0.05986443758010864, + "mean_token_accuracy": 0.9786281704902648, + "num_tokens": 7709745.0, + "step": 3300 + }, + { + "epoch": 8.209215442092155, + "eval_entropy": 0.24329388124305149, + "eval_loss": 0.9021085500717163, + "eval_mean_token_accuracy": 0.8521762625422589, + "eval_num_tokens": 7709745.0, + "eval_runtime": 85.955, + "eval_samples_per_second": 15.997, + "eval_steps_per_second": 2.001, + "step": 3300 + }, + { + "entropy": 0.13265180448070168, + "epoch": 8.259028642590286, + "grad_norm": 0.18067947030067444, + "learning_rate": 2.0320434085659692e-05, + "loss": 0.06724961400032044, + "mean_token_accuracy": 0.975098168104887, + "num_tokens": 7753571.0, + "step": 3320 + }, + { + "epoch": 8.259028642590286, + "eval_entropy": 0.2433211464694766, + "eval_loss": 0.9094350337982178, + "eval_mean_token_accuracy": 0.8520150094531304, + "eval_num_tokens": 7753571.0, + "eval_runtime": 85.7989, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.005, + "step": 3320 + }, + { + "entropy": 0.11949320202693343, + "epoch": 8.308841843088418, + "grad_norm": 0.17020289599895477, + "learning_rate": 1.9210999670114196e-05, + "loss": 0.0634455680847168, + "mean_token_accuracy": 0.9771294385194779, + "num_tokens": 7799310.0, + "step": 3340 + }, + { + "epoch": 8.308841843088418, + "eval_entropy": 0.24345201219237128, + "eval_loss": 0.9021793603897095, + "eval_mean_token_accuracy": 0.8520745697409607, + "eval_num_tokens": 7799310.0, + "eval_runtime": 86.0883, + "eval_samples_per_second": 15.972, + "eval_steps_per_second": 1.998, + "step": 3340 + }, + { + "entropy": 0.12065747743472457, + "epoch": 8.35865504358655, + "grad_norm": 0.16789060831069946, + "learning_rate": 1.8129892878049886e-05, + "loss": 0.061494195461273195, + "mean_token_accuracy": 0.9779584899544715, + "num_tokens": 7846447.0, + "step": 3360 + }, + { + "epoch": 8.35865504358655, + "eval_entropy": 0.24093415042342142, + "eval_loss": 0.9006755352020264, + "eval_mean_token_accuracy": 0.852174230786257, + "eval_num_tokens": 7846447.0, + "eval_runtime": 85.9011, + "eval_samples_per_second": 16.007, + "eval_steps_per_second": 2.002, + "step": 3360 + }, + { + "entropy": 0.13125578537583352, + "epoch": 8.408468244084682, + "grad_norm": 0.1662452220916748, + "learning_rate": 1.70774397565298e-05, + "loss": 0.06685600876808166, + "mean_token_accuracy": 0.9744067586958408, + "num_tokens": 7890283.0, + "step": 3380 + }, + { + "epoch": 8.408468244084682, + "eval_entropy": 0.24062153688350388, + "eval_loss": 0.9078915119171143, + "eval_mean_token_accuracy": 0.8523201647886011, + "eval_num_tokens": 7890283.0, + "eval_runtime": 86.0201, + "eval_samples_per_second": 15.985, + "eval_steps_per_second": 2.0, + "step": 3380 + }, + { + "entropy": 0.11986117120832204, + "epoch": 8.458281444582815, + "grad_norm": 0.19571948051452637, + "learning_rate": 1.6053957711060606e-05, + "loss": 0.06411095261573792, + "mean_token_accuracy": 0.9770627245306969, + "num_tokens": 7936518.0, + "step": 3400 + }, + { + "epoch": 8.458281444582815, + "eval_entropy": 0.24352820347561394, + "eval_loss": 0.9058943390846252, + "eval_mean_token_accuracy": 0.8519382792156797, + "eval_num_tokens": 7936518.0, + "eval_runtime": 85.966, + "eval_samples_per_second": 15.995, + "eval_steps_per_second": 2.001, + "step": 3400 + }, + { + "entropy": 0.12857897616922856, + "epoch": 8.508094645080947, + "grad_norm": 0.2609264850616455, + "learning_rate": 1.5059755409867613e-05, + "loss": 0.06473397612571716, + "mean_token_accuracy": 0.9764650195837021, + "num_tokens": 7981966.0, + "step": 3420 + }, + { + "epoch": 8.508094645080947, + "eval_entropy": 0.24032609000108962, + "eval_loss": 0.9077776074409485, + "eval_mean_token_accuracy": 0.8517829197090726, + "eval_num_tokens": 7981966.0, + "eval_runtime": 86.6059, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 3420 + }, + { + "entropy": 0.12348870886489749, + "epoch": 8.557907845579079, + "grad_norm": 0.19537609815597534, + "learning_rate": 1.409513269080473e-05, + "loss": 0.06481348872184753, + "mean_token_accuracy": 0.9769559659063816, + "num_tokens": 8028367.0, + "step": 3440 + }, + { + "epoch": 8.557907845579079, + "eval_entropy": 0.2404322574824788, + "eval_loss": 0.9057720899581909, + "eval_mean_token_accuracy": 0.8521037981953732, + "eval_num_tokens": 8028367.0, + "eval_runtime": 86.166, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.996, + "step": 3440 + }, + { + "entropy": 0.12040232736617326, + "epoch": 8.607721046077211, + "grad_norm": 0.3310582935810089, + "learning_rate": 1.3160380470927183e-05, + "loss": 0.06468871235847473, + "mean_token_accuracy": 0.9768650442361831, + "num_tokens": 8074934.0, + "step": 3460 + }, + { + "epoch": 8.607721046077211, + "eval_entropy": 0.24118655876711356, + "eval_loss": 0.9028318524360657, + "eval_mean_token_accuracy": 0.8521025340224422, + "eval_num_tokens": 8074934.0, + "eval_runtime": 85.3668, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.015, + "step": 3460 + }, + { + "entropy": 0.12328103906475008, + "epoch": 8.657534246575342, + "grad_norm": 0.12836167216300964, + "learning_rate": 1.2255780658755122e-05, + "loss": 0.06229386329650879, + "mean_token_accuracy": 0.9763277888298034, + "num_tokens": 8122775.0, + "step": 3480 + }, + { + "epoch": 8.657534246575342, + "eval_entropy": 0.24194598145956217, + "eval_loss": 0.9009329080581665, + "eval_mean_token_accuracy": 0.8521693289973015, + "eval_num_tokens": 8122775.0, + "eval_runtime": 85.9415, + "eval_samples_per_second": 15.999, + "eval_steps_per_second": 2.001, + "step": 3480 + }, + { + "entropy": 0.11321646976284683, + "epoch": 8.707347447073474, + "grad_norm": 0.15656894445419312, + "learning_rate": 1.1381606069253786e-05, + "loss": 0.05908188819885254, + "mean_token_accuracy": 0.9779504477977753, + "num_tokens": 8174307.0, + "step": 3500 + }, + { + "epoch": 8.707347447073474, + "eval_entropy": 0.24121542517528977, + "eval_loss": 0.9016091823577881, + "eval_mean_token_accuracy": 0.8521790667328724, + "eval_num_tokens": 8174307.0, + "eval_runtime": 85.7465, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.006, + "step": 3500 + }, + { + "entropy": 0.12657046681270004, + "epoch": 8.757160647571606, + "grad_norm": 0.22597502171993256, + "learning_rate": 1.053812034155629e-05, + "loss": 0.06244581937789917, + "mean_token_accuracy": 0.976795207709074, + "num_tokens": 8222808.0, + "step": 3520 + }, + { + "epoch": 8.757160647571606, + "eval_entropy": 0.23877542708502258, + "eval_loss": 0.9069110155105591, + "eval_mean_token_accuracy": 0.8522880177858264, + "eval_num_tokens": 8222808.0, + "eval_runtime": 85.7792, + "eval_samples_per_second": 16.03, + "eval_steps_per_second": 2.005, + "step": 3520 + }, + { + "entropy": 0.11422101808711886, + "epoch": 8.806973848069738, + "grad_norm": 0.21139323711395264, + "learning_rate": 9.725577859453502e-06, + "loss": 0.05988085865974426, + "mean_token_accuracy": 0.9779510758817196, + "num_tokens": 8273335.0, + "step": 3540 + }, + { + "epoch": 8.806973848069738, + "eval_entropy": 0.2393161087881687, + "eval_loss": 0.9033801555633545, + "eval_mean_token_accuracy": 0.8522614209457885, + "eval_num_tokens": 8273335.0, + "eval_runtime": 85.5594, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 3540 + }, + { + "entropy": 0.13810604228638113, + "epoch": 8.85678704856787, + "grad_norm": 0.24571993947029114, + "learning_rate": 8.944223674675537e-06, + "loss": 0.07036117911338806, + "mean_token_accuracy": 0.9734892748296261, + "num_tokens": 8315235.0, + "step": 3560 + }, + { + "epoch": 8.85678704856787, + "eval_entropy": 0.23998506947658782, + "eval_loss": 0.9009848833084106, + "eval_mean_token_accuracy": 0.8521793619837872, + "eval_num_tokens": 8315235.0, + "eval_runtime": 86.0974, + "eval_samples_per_second": 15.97, + "eval_steps_per_second": 1.998, + "step": 3560 + }, + { + "entropy": 0.14193559321574867, + "epoch": 8.906600249066003, + "grad_norm": 0.17304112017154694, + "learning_rate": 8.194293432987386e-06, + "loss": 0.07077967524528503, + "mean_token_accuracy": 0.973305893689394, + "num_tokens": 8358099.0, + "step": 3580 + }, + { + "epoch": 8.906600249066003, + "eval_entropy": 0.23883876689644748, + "eval_loss": 0.9015622138977051, + "eval_mean_token_accuracy": 0.8524864378363587, + "eval_num_tokens": 8358099.0, + "eval_runtime": 86.0089, + "eval_samples_per_second": 15.987, + "eval_steps_per_second": 2.0, + "step": 3580 + }, + { + "entropy": 0.11878943420015275, + "epoch": 8.956413449564135, + "grad_norm": 0.19075658917427063, + "learning_rate": 7.476013303121426e-06, + "loss": 0.060806107521057126, + "mean_token_accuracy": 0.9776863709092141, + "num_tokens": 8407430.0, + "step": 3600 + }, + { + "epoch": 8.956413449564135, + "eval_entropy": 0.23726526309931, + "eval_loss": 0.9060276746749878, + "eval_mean_token_accuracy": 0.8524192058762838, + "eval_num_tokens": 8407430.0, + "eval_runtime": 85.7252, + "eval_samples_per_second": 16.04, + "eval_steps_per_second": 2.006, + "step": 3600 + }, + { + "entropy": 0.1255835090787747, + "epoch": 9.004981320049813, + "grad_norm": 0.11608047038316727, + "learning_rate": 6.78959990856799e-06, + "loss": 0.06319612860679627, + "mean_token_accuracy": 0.9766685519462976, + "num_tokens": 8453175.0, + "step": 3620 + }, + { + "epoch": 9.004981320049813, + "eval_entropy": 0.2373251837006835, + "eval_loss": 0.9045722484588623, + "eval_mean_token_accuracy": 0.8525558363559634, + "eval_num_tokens": 8453175.0, + "eval_runtime": 85.7435, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.006, + "step": 3620 + }, + { + "entropy": 0.12587778437882663, + "epoch": 9.054794520547945, + "grad_norm": 0.1564614623785019, + "learning_rate": 6.135260262244683e-06, + "loss": 0.0630365788936615, + "mean_token_accuracy": 0.9777486085891723, + "num_tokens": 8497151.0, + "step": 3640 + }, + { + "epoch": 9.054794520547945, + "eval_entropy": 0.23559923721260803, + "eval_loss": 0.9120694398880005, + "eval_mean_token_accuracy": 0.8525292966947999, + "eval_num_tokens": 8497151.0, + "eval_runtime": 85.8018, + "eval_samples_per_second": 16.025, + "eval_steps_per_second": 2.005, + "step": 3640 + }, + { + "entropy": 0.12535365503281354, + "epoch": 9.104607721046078, + "grad_norm": 0.1404249221086502, + "learning_rate": 5.513191704064086e-06, + "loss": 0.060502654314041136, + "mean_token_accuracy": 0.9770058333873749, + "num_tokens": 8542996.0, + "step": 3660 + }, + { + "epoch": 9.104607721046078, + "eval_entropy": 0.23525122691725575, + "eval_loss": 0.9182237982749939, + "eval_mean_token_accuracy": 0.8524098333924316, + "eval_num_tokens": 8542996.0, + "eval_runtime": 85.9872, + "eval_samples_per_second": 15.991, + "eval_steps_per_second": 2.0, + "step": 3660 + }, + { + "entropy": 0.11330419047735632, + "epoch": 9.15442092154421, + "grad_norm": 0.15513843297958374, + "learning_rate": 4.92358184141876e-06, + "loss": 0.05822383761405945, + "mean_token_accuracy": 0.9793384782969952, + "num_tokens": 8591625.0, + "step": 3680 + }, + { + "epoch": 9.15442092154421, + "eval_entropy": 0.2353947116711805, + "eval_loss": 0.9229223132133484, + "eval_mean_token_accuracy": 0.852500357253607, + "eval_num_tokens": 8591625.0, + "eval_runtime": 86.0805, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.998, + "step": 3680 + }, + { + "entropy": 0.11830627010203898, + "epoch": 9.204234122042342, + "grad_norm": 0.1730550080537796, + "learning_rate": 4.366608492601456e-06, + "loss": 0.05860854983329773, + "mean_token_accuracy": 0.9779663667082786, + "num_tokens": 8639845.0, + "step": 3700 + }, + { + "epoch": 9.204234122042342, + "eval_entropy": 0.23567205719476522, + "eval_loss": 0.9269373416900635, + "eval_mean_token_accuracy": 0.8523658004611038, + "eval_num_tokens": 8639845.0, + "eval_runtime": 85.9809, + "eval_samples_per_second": 15.992, + "eval_steps_per_second": 2.0, + "step": 3700 + }, + { + "entropy": 0.1180900705512613, + "epoch": 9.254047322540472, + "grad_norm": 0.20909737050533295, + "learning_rate": 3.842439633177387e-06, + "loss": 0.059438884258270264, + "mean_token_accuracy": 0.9786856278777123, + "num_tokens": 8687194.0, + "step": 3720 + }, + { + "epoch": 9.254047322540472, + "eval_entropy": 0.23602714493524196, + "eval_loss": 0.9293538928031921, + "eval_mean_token_accuracy": 0.8523273440294488, + "eval_num_tokens": 8687194.0, + "eval_runtime": 85.2118, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.019, + "step": 3720 + }, + { + "entropy": 0.13156692241318524, + "epoch": 9.303860523038605, + "grad_norm": 0.12535709142684937, + "learning_rate": 3.3512333453253305e-06, + "loss": 0.06337688565254211, + "mean_token_accuracy": 0.9756712593138218, + "num_tokens": 8731721.0, + "step": 3740 + }, + { + "epoch": 9.303860523038605, + "eval_entropy": 0.23534389351343, + "eval_loss": 0.932999312877655, + "eval_mean_token_accuracy": 0.8523333925147389, + "eval_num_tokens": 8731721.0, + "eval_runtime": 85.953, + "eval_samples_per_second": 15.997, + "eval_steps_per_second": 2.001, + "step": 3740 + }, + { + "entropy": 0.12327516414225101, + "epoch": 9.353673723536737, + "grad_norm": 0.16341575980186462, + "learning_rate": 2.8931377701619306e-06, + "loss": 0.05869622826576233, + "mean_token_accuracy": 0.9784224212169648, + "num_tokens": 8778614.0, + "step": 3760 + }, + { + "epoch": 9.353673723536737, + "eval_entropy": 0.23493653622477553, + "eval_loss": 0.9358566999435425, + "eval_mean_token_accuracy": 0.8522722783476807, + "eval_num_tokens": 8778614.0, + "eval_runtime": 85.2538, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.018, + "step": 3760 + }, + { + "entropy": 0.1134357453789562, + "epoch": 9.403486924034869, + "grad_norm": 0.23999616503715515, + "learning_rate": 2.4682910630645723e-06, + "loss": 0.057540220022201535, + "mean_token_accuracy": 0.9798057802021504, + "num_tokens": 8826551.0, + "step": 3780 + }, + { + "epoch": 9.403486924034869, + "eval_entropy": 0.23470525634150172, + "eval_loss": 0.937556266784668, + "eval_mean_token_accuracy": 0.8523351706044618, + "eval_num_tokens": 8826551.0, + "eval_runtime": 85.7764, + "eval_samples_per_second": 16.03, + "eval_steps_per_second": 2.005, + "step": 3780 + }, + { + "entropy": 0.1075570048764348, + "epoch": 9.453300124533001, + "grad_norm": 0.15417765080928802, + "learning_rate": 2.0768213520055406e-06, + "loss": 0.05581026673316956, + "mean_token_accuracy": 0.9797527104616165, + "num_tokens": 8876556.0, + "step": 3800 + }, + { + "epoch": 9.453300124533001, + "eval_entropy": 0.2347462713545145, + "eval_loss": 0.9383137226104736, + "eval_mean_token_accuracy": 0.8522575324357942, + "eval_num_tokens": 8876556.0, + "eval_runtime": 85.8985, + "eval_samples_per_second": 16.007, + "eval_steps_per_second": 2.002, + "step": 3800 + }, + { + "entropy": 0.12609313456341625, + "epoch": 9.503113325031133, + "grad_norm": 0.22041426599025726, + "learning_rate": 1.7188466989102739e-06, + "loss": 0.06379218697547913, + "mean_token_accuracy": 0.9763593293726445, + "num_tokens": 8920286.0, + "step": 3820 + }, + { + "epoch": 9.503113325031133, + "eval_entropy": 0.23459658849724505, + "eval_loss": 0.9393337965011597, + "eval_mean_token_accuracy": 0.8523633532052817, + "eval_num_tokens": 8920286.0, + "eval_runtime": 85.9348, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.002, + "step": 3820 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.767130308622766e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3840/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3840/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3840/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3840/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3840/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3840/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3840/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3840/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3840/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3840/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3840/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3840/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3840/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3840/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..aced71fb07e6534e9340c70d5c351cfcb35f5df8 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3840/trainer_state.json @@ -0,0 +1,4066 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 9.552926525529266, + "eval_steps": 20, + "global_step": 3840, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + }, + { + "entropy": 0.561330484598875, + "epoch": 1.891656288916563, + "grad_norm": 0.6722865700721741, + "learning_rate": 0.0002208867897174789, + "loss": 0.499837589263916, + "mean_token_accuracy": 0.8518734864890576, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.5865232653396074, + "eval_loss": 0.5437926650047302, + "eval_mean_token_accuracy": 0.8450997017843779, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4116, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.547389242425561, + "epoch": 1.9414694894146949, + "grad_norm": 0.7935577034950256, + "learning_rate": 0.00022027119820226907, + "loss": 0.4977591514587402, + "mean_token_accuracy": 0.8539491161704064, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.5290903090391048, + "eval_loss": 0.5409526824951172, + "eval_mean_token_accuracy": 0.8497545698354411, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.7262, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 780 + }, + { + "entropy": 0.5687909748405218, + "epoch": 1.9912826899128269, + "grad_norm": 0.6180546283721924, + "learning_rate": 0.00021962329729698345, + "loss": 0.5109643459320068, + "mean_token_accuracy": 0.8521598495543004, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.5503541858390321, + "eval_loss": 0.5361555218696594, + "eval_mean_token_accuracy": 0.8510884285666221, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.3339, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 800 + }, + { + "entropy": 0.4739728841261986, + "epoch": 2.0398505603985058, + "grad_norm": 0.8058829307556152, + "learning_rate": 0.0002189432823996982, + "loss": 0.4204097747802734, + "mean_token_accuracy": 0.8728981889211215, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.5077334992414297, + "eval_loss": 0.5531114339828491, + "eval_mean_token_accuracy": 0.8489257208136625, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.4801, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.989, + "step": 820 + }, + { + "entropy": 0.4594309840351343, + "epoch": 2.0896637608966375, + "grad_norm": 0.6906896829605103, + "learning_rate": 0.0002182313585936314, + "loss": 0.4071959495544434, + "mean_token_accuracy": 0.8732857562601566, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.49850136994622474, + "eval_loss": 0.5486204624176025, + "eval_mean_token_accuracy": 0.8507991450470548, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.3364, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.4881629109382629, + "epoch": 2.1394769613947697, + "grad_norm": 0.6343470215797424, + "learning_rate": 0.0002174877405852928, + "loss": 0.41669540405273436, + "mean_token_accuracy": 0.8711295068264008, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.49155513924914734, + "eval_loss": 0.555109441280365, + "eval_mean_token_accuracy": 0.8496399400539176, + "eval_num_tokens": 2008562.0, + "eval_runtime": 86.3295, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 860 + }, + { + "entropy": 0.4648668970912695, + "epoch": 2.1892901618929015, + "grad_norm": 0.8014165163040161, + "learning_rate": 0.00021671265263973133, + "loss": 0.4110250473022461, + "mean_token_accuracy": 0.8754166305065155, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.4909258722219356, + "eval_loss": 0.5539511442184448, + "eval_mean_token_accuracy": 0.8492401502160138, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.3468, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 880 + }, + { + "entropy": 0.4824485514312983, + "epoch": 2.2391033623910337, + "grad_norm": 0.6665191054344177, + "learning_rate": 0.00021590632851289967, + "loss": 0.4181404113769531, + "mean_token_accuracy": 0.8726993151009083, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.4986876940657926, + "eval_loss": 0.547695517539978, + "eval_mean_token_accuracy": 0.8501384708770486, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.3838, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 900 + }, + { + "entropy": 0.4751896943897009, + "epoch": 2.2889165628891655, + "grad_norm": 0.81158047914505, + "learning_rate": 0.00021506901138115678, + "loss": 0.40689678192138673, + "mean_token_accuracy": 0.8745221219956875, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.507153491121392, + "eval_loss": 0.5501641631126404, + "eval_mean_token_accuracy": 0.8495670116918032, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.0912, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 920 + }, + { + "entropy": 0.4873133715242147, + "epoch": 2.3387297633872977, + "grad_norm": 0.7218056321144104, + "learning_rate": 0.0002142009537679292, + "loss": 0.42701358795166017, + "mean_token_accuracy": 0.8695114746689796, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5202612736543943, + "eval_loss": 0.5491839051246643, + "eval_mean_token_accuracy": 0.8494071208460386, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.1142, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 940 + }, + { + "entropy": 0.4762951169162989, + "epoch": 2.3885429638854294, + "grad_norm": 0.7194424867630005, + "learning_rate": 0.0002133024174675534, + "loss": 0.42299847602844237, + "mean_token_accuracy": 0.8709790132939815, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4899340462546016, + "eval_loss": 0.5522511601448059, + "eval_mean_token_accuracy": 0.8492208258357159, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.463, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 960 + }, + { + "entropy": 0.49650347977876663, + "epoch": 2.4383561643835616, + "grad_norm": 0.8406022787094116, + "learning_rate": 0.0002123736734663221, + "loss": 0.4275330066680908, + "mean_token_accuracy": 0.8670595556497573, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.49691385654515996, + "eval_loss": 0.5491269826889038, + "eval_mean_token_accuracy": 0.850309816210769, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.17, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 980 + }, + { + "entropy": 0.48843890577554705, + "epoch": 2.488169364881694, + "grad_norm": 0.9082473516464233, + "learning_rate": 0.00021141500186075868, + "loss": 0.4309722423553467, + "mean_token_accuracy": 0.8686766296625137, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5543508351195691, + "eval_loss": 0.5478800535202026, + "eval_mean_token_accuracy": 0.8478029522784921, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.3835, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 1000 + }, + { + "entropy": 0.4777219031006098, + "epoch": 2.5379825653798256, + "grad_norm": 0.7448089122772217, + "learning_rate": 0.0002104266917731438, + "loss": 0.423325252532959, + "mean_token_accuracy": 0.8706337086856365, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.49857561550168106, + "eval_loss": 0.5511948466300964, + "eval_mean_token_accuracy": 0.8502220289651737, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.5399, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.988, + "step": 1020 + }, + { + "entropy": 0.4844174191355705, + "epoch": 2.587795765877958, + "grad_norm": 0.794029176235199, + "learning_rate": 0.00020940904126432, + "loss": 0.4176753044128418, + "mean_token_accuracy": 0.873535567522049, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.485467542222766, + "eval_loss": 0.5539286732673645, + "eval_mean_token_accuracy": 0.8495475081510322, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.135, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 1.997, + "step": 1040 + }, + { + "entropy": 0.49070929251611234, + "epoch": 2.6376089663760895, + "grad_norm": 0.7558256983757019, + "learning_rate": 0.0002083623572438007, + "loss": 0.42867293357849123, + "mean_token_accuracy": 0.8696666076779366, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.490822730889154, + "eval_loss": 0.5434785485267639, + "eval_mean_token_accuracy": 0.850568296950917, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.4933, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 1060 + }, + { + "entropy": 0.47806114703416824, + "epoch": 2.6874221668742218, + "grad_norm": 0.6608979105949402, + "learning_rate": 0.00020728695537721047, + "loss": 0.4289727687835693, + "mean_token_accuracy": 0.8693130135536193, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.5285773256490397, + "eval_loss": 0.5444230437278748, + "eval_mean_token_accuracy": 0.8498796481032704, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.7091, + "eval_samples_per_second": 15.858, + "eval_steps_per_second": 1.984, + "step": 1080 + }, + { + "entropy": 0.5046216730028391, + "epoch": 2.7372353673723535, + "grad_norm": 0.8428544998168945, + "learning_rate": 0.00020618315999108454, + "loss": 0.43131070137023925, + "mean_token_accuracy": 0.8701941035687923, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.49888394738352576, + "eval_loss": 0.5459766387939453, + "eval_mean_token_accuracy": 0.8511758872935938, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.2222, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.995, + "step": 1100 + }, + { + "entropy": 0.5212558470666409, + "epoch": 2.7870485678704857, + "grad_norm": 1.129318118095398, + "learning_rate": 0.00020505130397505635, + "loss": 0.44249300956726073, + "mean_token_accuracy": 0.8654101334512234, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5179622324053631, + "eval_loss": 0.5522801280021667, + "eval_mean_token_accuracy": 0.8497019947268242, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.1903, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.996, + "step": 1120 + }, + { + "entropy": 0.4988406613469124, + "epoch": 2.8368617683686175, + "grad_norm": 0.6460545063018799, + "learning_rate": 0.00020389172868146263, + "loss": 0.4386270523071289, + "mean_token_accuracy": 0.8690383620560169, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.5042278484203094, + "eval_loss": 0.5433034300804138, + "eval_mean_token_accuracy": 0.8497674451317898, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.3028, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.993, + "step": 1140 + }, + { + "entropy": 0.4926559619605541, + "epoch": 2.8866749688667497, + "grad_norm": 0.8199329972267151, + "learning_rate": 0.00020270478382239615, + "loss": 0.4313485145568848, + "mean_token_accuracy": 0.8674727231264114, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.503873193160046, + "eval_loss": 0.5388111472129822, + "eval_mean_token_accuracy": 0.8526195034731266, + "eval_num_tokens": 2710196.0, + "eval_runtime": 86.4054, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.991, + "step": 1160 + }, + { + "entropy": 0.5020013231784105, + "epoch": 2.936488169364882, + "grad_norm": 0.7344821095466614, + "learning_rate": 0.00020149082736423723, + "loss": 0.43590536117553713, + "mean_token_accuracy": 0.8671772189438343, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5368241809828337, + "eval_loss": 0.5355703830718994, + "eval_mean_token_accuracy": 0.8517617773871089, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.2945, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1180 + }, + { + "entropy": 0.5112275708466768, + "epoch": 2.9863013698630136, + "grad_norm": 0.6951606869697571, + "learning_rate": 0.00020025022541969622, + "loss": 0.43579301834106443, + "mean_token_accuracy": 0.8641206480562686, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.5066795706055885, + "eval_loss": 0.5415249466896057, + "eval_mean_token_accuracy": 0.8493563373421513, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.5005, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.988, + "step": 1200 + }, + { + "entropy": 0.42298635305502474, + "epoch": 3.0348692403486925, + "grad_norm": 0.8201794028282166, + "learning_rate": 0.00019898335213739863, + "loss": 0.35593905448913576, + "mean_token_accuracy": 0.889238600547497, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.4584170470750609, + "eval_loss": 0.569487452507019, + "eval_mean_token_accuracy": 0.8495814173027526, + "eval_num_tokens": 2848509.0, + "eval_runtime": 86.2281, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 1220 + }, + { + "entropy": 0.37450140453875064, + "epoch": 3.0846824408468243, + "grad_norm": 0.7308394908905029, + "learning_rate": 0.0001976905895890471, + "loss": 0.307823920249939, + "mean_token_accuracy": 0.9001288741827012, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.45185995916294497, + "eval_loss": 0.5672881603240967, + "eval_mean_token_accuracy": 0.8511318519364955, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.0819, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.998, + "step": 1240 + }, + { + "entropy": 0.3887945845723152, + "epoch": 3.1344956413449565, + "grad_norm": 0.7299330830574036, + "learning_rate": 0.0001963723276541939, + "loss": 0.32047903537750244, + "mean_token_accuracy": 0.8960984498262405, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.44865354549053105, + "eval_loss": 0.5666037201881409, + "eval_mean_token_accuracy": 0.8496572649063066, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 1260 + }, + { + "entropy": 0.39677664265036583, + "epoch": 3.1843088418430883, + "grad_norm": 0.9533219933509827, + "learning_rate": 0.00019502896390265838, + "loss": 0.3253983497619629, + "mean_token_accuracy": 0.8964207418262958, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.4641980809527774, + "eval_loss": 0.5814996957778931, + "eval_mean_token_accuracy": 0.8485886212005171, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.7784, + "eval_samples_per_second": 15.845, + "eval_steps_per_second": 1.982, + "step": 1280 + }, + { + "entropy": 0.39210722744464876, + "epoch": 3.2341220423412205, + "grad_norm": 0.7447651028633118, + "learning_rate": 0.00019366090347462545, + "loss": 0.3276803970336914, + "mean_token_accuracy": 0.8930055953562259, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43595615254585135, + "eval_loss": 0.5722188353538513, + "eval_mean_token_accuracy": 0.8501105755567551, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.5271, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 1300 + }, + { + "entropy": 0.3684127271175385, + "epoch": 3.2839352428393527, + "grad_norm": 0.6934201121330261, + "learning_rate": 0.00019226855895846078, + "loss": 0.3156379222869873, + "mean_token_accuracy": 0.8976306475698947, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.4628148723480313, + "eval_loss": 0.5631352066993713, + "eval_mean_token_accuracy": 0.8504934813394103, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.3436, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 1320 + }, + { + "entropy": 0.4073401909321547, + "epoch": 3.3337484433374844, + "grad_norm": 0.9386897683143616, + "learning_rate": 0.00019085235026627994, + "loss": 0.34265310764312745, + "mean_token_accuracy": 0.8902062118053437, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.46455050623694133, + "eval_loss": 0.5586736798286438, + "eval_mean_token_accuracy": 0.8506874702004499, + "eval_num_tokens": 3132874.0, + "eval_runtime": 86.1286, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.997, + "step": 1340 + }, + { + "entropy": 0.4046429242938757, + "epoch": 3.383561643835616, + "grad_norm": 0.9633992314338684, + "learning_rate": 0.00018941270450730836, + "loss": 0.33816893100738527, + "mean_token_accuracy": 0.8927541889250279, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.46846531660750856, + "eval_loss": 0.561501681804657, + "eval_mean_token_accuracy": 0.8496256377114806, + "eval_num_tokens": 3178055.0, + "eval_runtime": 86.685, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1360 + }, + { + "entropy": 0.39872407019138334, + "epoch": 3.4333748443337484, + "grad_norm": 0.7786458730697632, + "learning_rate": 0.00018795005585907113, + "loss": 0.33342490196228025, + "mean_token_accuracy": 0.8944805048406124, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.42709505973860273, + "eval_loss": 0.5751848220825195, + "eval_mean_token_accuracy": 0.8507290447867194, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.6892, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 1380 + }, + { + "entropy": 0.3923338124528527, + "epoch": 3.4831880448318806, + "grad_norm": 0.9305956363677979, + "learning_rate": 0.0001864648454364511, + "loss": 0.33188116550445557, + "mean_token_accuracy": 0.8943330392241478, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.4386174779298694, + "eval_loss": 0.5680831074714661, + "eval_mean_token_accuracy": 0.8513129727784977, + "eval_num_tokens": 3274096.0, + "eval_runtime": 86.2671, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 1400 + }, + { + "entropy": 0.3856233984231949, + "epoch": 3.5330012453300124, + "grad_norm": 1.0362752676010132, + "learning_rate": 0.0001849575211586545, + "loss": 0.33098697662353516, + "mean_token_accuracy": 0.8961390435695649, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4574795474493226, + "eval_loss": 0.5630439519882202, + "eval_mean_token_accuracy": 0.8520988873964133, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.6035, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 1420 + }, + { + "entropy": 0.39812871962785723, + "epoch": 3.5828144458281446, + "grad_norm": 0.7807195782661438, + "learning_rate": 0.0001834285376141247, + "loss": 0.3333771228790283, + "mean_token_accuracy": 0.8930827379226685, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.4556825893909432, + "eval_loss": 0.5689062476158142, + "eval_mean_token_accuracy": 0.8507103507601937, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.1606, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.996, + "step": 1440 + }, + { + "entropy": 0.4147744856774807, + "epoch": 3.6326276463262763, + "grad_norm": 0.6429352164268494, + "learning_rate": 0.00018187835592344443, + "loss": 0.3482560873031616, + "mean_token_accuracy": 0.8910200245678425, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.46600024540757023, + "eval_loss": 0.5609709024429321, + "eval_mean_token_accuracy": 0.8491220876227977, + "eval_num_tokens": 3415600.0, + "eval_runtime": 86.8039, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1460 + }, + { + "entropy": 0.40425071083009245, + "epoch": 3.6824408468244085, + "grad_norm": 0.8613698482513428, + "learning_rate": 0.0001803074436002682, + "loss": 0.342916464805603, + "mean_token_accuracy": 0.8916418336331844, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.43855057899342026, + "eval_loss": 0.5720968246459961, + "eval_mean_token_accuracy": 0.8500823641932288, + "eval_num_tokens": 3460471.0, + "eval_runtime": 86.6746, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1480 + }, + { + "entropy": 0.39465143866837027, + "epoch": 3.7322540473225407, + "grad_norm": 0.6285189986228943, + "learning_rate": 0.0001787162744103265, + "loss": 0.3424591779708862, + "mean_token_accuracy": 0.8906558901071548, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4509461877304454, + "eval_loss": 0.5590082406997681, + "eval_mean_token_accuracy": 0.8511747371318729, + "eval_num_tokens": 3507647.0, + "eval_runtime": 86.8126, + "eval_samples_per_second": 15.839, + "eval_steps_per_second": 1.981, + "step": 1500 + }, + { + "entropy": 0.4021005939692259, + "epoch": 3.7820672478206725, + "grad_norm": 0.8821248412132263, + "learning_rate": 0.00017710532822854468, + "loss": 0.3462103843688965, + "mean_token_accuracy": 0.889109355956316, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.4502199075596277, + "eval_loss": 0.566046416759491, + "eval_mean_token_accuracy": 0.8501714208098345, + "eval_num_tokens": 3548934.0, + "eval_runtime": 86.8336, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.981, + "step": 1520 + }, + { + "entropy": 0.4017397932708263, + "epoch": 3.8318804483188043, + "grad_norm": 0.8400952816009521, + "learning_rate": 0.0001754750908943189, + "loss": 0.34890995025634763, + "mean_token_accuracy": 0.8892098367214203, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.4614003023435903, + "eval_loss": 0.5617933869361877, + "eval_mean_token_accuracy": 0.8515863616106122, + "eval_num_tokens": 3597186.0, + "eval_runtime": 86.4609, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 1540 + }, + { + "entropy": 0.4112051840871572, + "epoch": 3.8816936488169365, + "grad_norm": 0.769478440284729, + "learning_rate": 0.0001738260540649939, + "loss": 0.34711437225341796, + "mean_token_accuracy": 0.8911717928946018, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4540443811998811, + "eval_loss": 0.5576469898223877, + "eval_mean_token_accuracy": 0.8512079674144124, + "eval_num_tokens": 3646646.0, + "eval_runtime": 86.5103, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 1560 + }, + { + "entropy": 0.41105241514742374, + "epoch": 3.9315068493150687, + "grad_norm": 0.8468427062034607, + "learning_rate": 0.00017215871506758568, + "loss": 0.3433023452758789, + "mean_token_accuracy": 0.8898739732801915, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.4707539707075718, + "eval_loss": 0.5641466379165649, + "eval_mean_token_accuracy": 0.8495440957851188, + "eval_num_tokens": 3689560.0, + "eval_runtime": 86.609, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.986, + "step": 1580 + }, + { + "entropy": 0.41016379147768023, + "epoch": 3.9813200498132004, + "grad_norm": 0.7482675313949585, + "learning_rate": 0.0001704735767487946, + "loss": 0.34550890922546384, + "mean_token_accuracy": 0.8893028847873211, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.46391099864660307, + "eval_loss": 0.5593640804290771, + "eval_mean_token_accuracy": 0.8510130581467651, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.3975, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 1600 + }, + { + "entropy": 0.33167599791135544, + "epoch": 4.029887920298879, + "grad_norm": 0.9435692429542542, + "learning_rate": 0.00016877114732335337, + "loss": 0.2716026544570923, + "mean_token_accuracy": 0.9133149828666296, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.38499350005457567, + "eval_loss": 0.6298249363899231, + "eval_mean_token_accuracy": 0.8488117071778275, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.2933, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1620 + }, + { + "entropy": 0.3000166634097695, + "epoch": 4.0797011207970115, + "grad_norm": 0.8080845475196838, + "learning_rate": 0.0001670519402207569, + "loss": 0.22617182731628419, + "mean_token_accuracy": 0.9253474645316601, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.370110988703578, + "eval_loss": 0.6338461637496948, + "eval_mean_token_accuracy": 0.8485634801692741, + "eval_num_tokens": 3828830.0, + "eval_runtime": 85.9508, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.001, + "step": 1640 + }, + { + "entropy": 0.2986910421401262, + "epoch": 4.129514321295143, + "grad_norm": 0.7310900092124939, + "learning_rate": 0.0001653164739304185, + "loss": 0.22367463111877442, + "mean_token_accuracy": 0.9252275295555592, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.3944379702037157, + "eval_loss": 0.6109381914138794, + "eval_mean_token_accuracy": 0.849291454220927, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.6728, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1660 + }, + { + "entropy": 0.3095553796738386, + "epoch": 4.179327521793275, + "grad_norm": 0.7059140801429749, + "learning_rate": 0.0001635652718453007, + "loss": 0.23651680946350098, + "mean_token_accuracy": 0.9208931416273117, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.3910588648949945, + "eval_loss": 0.6104469299316406, + "eval_mean_token_accuracy": 0.8486883893262508, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7612, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.982, + "step": 1680 + }, + { + "entropy": 0.3001101028174162, + "epoch": 4.229140722291407, + "grad_norm": 0.6787802577018738, + "learning_rate": 0.00016179886210406728, + "loss": 0.23130471706390382, + "mean_token_accuracy": 0.9233332790434361, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3794369170832079, + "eval_loss": 0.6182110905647278, + "eval_mean_token_accuracy": 0.8495433777570724, + "eval_num_tokens": 3967474.0, + "eval_runtime": 85.94, + "eval_samples_per_second": 16.0, + "eval_steps_per_second": 2.001, + "step": 1700 + }, + { + "entropy": 0.3031421799212694, + "epoch": 4.2789539227895395, + "grad_norm": 0.9732038378715515, + "learning_rate": 0.0001600177774318036, + "loss": 0.2359529733657837, + "mean_token_accuracy": 0.9217648565769195, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3923123094231583, + "eval_loss": 0.6057384610176086, + "eval_mean_token_accuracy": 0.8508818288182103, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7647, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.29365369994193313, + "epoch": 4.328767123287671, + "grad_norm": 0.7681498527526855, + "learning_rate": 0.0001582225549793541, + "loss": 0.2269371747970581, + "mean_token_accuracy": 0.9245341829955578, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.4011661055129628, + "eval_loss": 0.6144486665725708, + "eval_mean_token_accuracy": 0.8480324357054955, + "eval_num_tokens": 4062594.0, + "eval_runtime": 87.1306, + "eval_samples_per_second": 15.781, + "eval_steps_per_second": 1.974, + "step": 1740 + }, + { + "entropy": 0.29396994728595016, + "epoch": 4.378580323785803, + "grad_norm": 1.0001007318496704, + "learning_rate": 0.0001564137361613248, + "loss": 0.22777395248413085, + "mean_token_accuracy": 0.9262309700250626, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38518730195802314, + "eval_loss": 0.6202630400657654, + "eval_mean_token_accuracy": 0.8493869807137999, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6616, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.3096018506214023, + "epoch": 4.428393524283935, + "grad_norm": 1.0448365211486816, + "learning_rate": 0.00015459186649280024, + "loss": 0.23696351051330566, + "mean_token_accuracy": 0.9217322513461113, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.3946371126140273, + "eval_loss": 0.6079026460647583, + "eval_mean_token_accuracy": 0.8492515852978063, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6582, + "eval_samples_per_second": 15.867, + "eval_steps_per_second": 1.985, + "step": 1780 + }, + { + "entropy": 0.32619857545942066, + "epoch": 4.478206724782067, + "grad_norm": 0.7210651636123657, + "learning_rate": 0.00015275749542482337, + "loss": 0.24651215076446534, + "mean_token_accuracy": 0.9177676141262054, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.3947690814560236, + "eval_loss": 0.6065912246704102, + "eval_mean_token_accuracy": 0.8502957744653835, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.5959, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.986, + "step": 1800 + }, + { + "entropy": 0.3193941755220294, + "epoch": 4.5280199252802, + "grad_norm": 0.8281906843185425, + "learning_rate": 0.0001509111761786888, + "loss": 0.23936262130737304, + "mean_token_accuracy": 0.9201708927750587, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38704028864239537, + "eval_loss": 0.6006569266319275, + "eval_mean_token_accuracy": 0.8502406720505205, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.8059, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1820 + }, + { + "entropy": 0.3164879363030195, + "epoch": 4.577833125778331, + "grad_norm": 0.7892968654632568, + "learning_rate": 0.00014905346557909867, + "loss": 0.24541733264923096, + "mean_token_accuracy": 0.9175932116806507, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.38861122120951497, + "eval_loss": 0.6115967631340027, + "eval_mean_token_accuracy": 0.849471275196519, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.2946, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1840 + }, + { + "entropy": 0.3051785985007882, + "epoch": 4.627646326276463, + "grad_norm": 0.8109654188156128, + "learning_rate": 0.0001471849238862319, + "loss": 0.23433220386505127, + "mean_token_accuracy": 0.9206570319831371, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.37162452295076015, + "eval_loss": 0.6184061765670776, + "eval_mean_token_accuracy": 0.8501173268223918, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.6865, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1860 + }, + { + "entropy": 0.3168198253959417, + "epoch": 4.677459526774595, + "grad_norm": 0.9512342214584351, + "learning_rate": 0.0001453061146267775, + "loss": 0.23832404613494873, + "mean_token_accuracy": 0.9197044663131237, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3845940856912801, + "eval_loss": 0.606762707233429, + "eval_mean_token_accuracy": 0.8504838194957999, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.5175, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 1880 + }, + { + "entropy": 0.30791807882487776, + "epoch": 4.7272727272727275, + "grad_norm": 0.8123113512992859, + "learning_rate": 0.00014341760442398248, + "loss": 0.2395785331726074, + "mean_token_accuracy": 0.918928150832653, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.39762327222283494, + "eval_loss": 0.5994202494621277, + "eval_mean_token_accuracy": 0.8509274201337681, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.2873, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.993, + "step": 1900 + }, + { + "entropy": 0.3021434534341097, + "epoch": 4.777085927770859, + "grad_norm": 0.731787383556366, + "learning_rate": 0.000141519962826766, + "loss": 0.23494718074798585, + "mean_token_accuracy": 0.9201403826475143, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.3827026732439219, + "eval_loss": 0.5995895862579346, + "eval_mean_token_accuracy": 0.851468373523202, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.3006, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 1920 + }, + { + "entropy": 0.31626159623265265, + "epoch": 4.826899128268991, + "grad_norm": 0.8848487138748169, + "learning_rate": 0.00013961376213795132, + "loss": 0.2439030647277832, + "mean_token_accuracy": 0.9196575872600079, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.388698436839636, + "eval_loss": 0.6000174283981323, + "eval_mean_token_accuracy": 0.8518068187458571, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.8979, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.979, + "step": 1940 + }, + { + "entropy": 0.30520407035946845, + "epoch": 4.876712328767123, + "grad_norm": 0.8532460927963257, + "learning_rate": 0.00013769957724166695, + "loss": 0.23458616733551024, + "mean_token_accuracy": 0.9221912942826748, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.38777847102908203, + "eval_loss": 0.6004981398582458, + "eval_mean_token_accuracy": 0.8516481768253238, + "eval_num_tokens": 4578167.0, + "eval_runtime": 87.0777, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.975, + "step": 1960 + }, + { + "entropy": 0.3226448342204094, + "epoch": 4.926525529265255, + "grad_norm": 0.6945561766624451, + "learning_rate": 0.0001357779854299694, + "loss": 0.24048397541046143, + "mean_token_accuracy": 0.9195300146937371, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.38581624263247777, + "eval_loss": 0.6029234528541565, + "eval_mean_token_accuracy": 0.8514213260523108, + "eval_num_tokens": 4622316.0, + "eval_runtime": 85.8729, + "eval_samples_per_second": 16.012, + "eval_steps_per_second": 2.003, + "step": 1980 + }, + { + "entropy": 0.3051655298098922, + "epoch": 4.976338729763388, + "grad_norm": 0.7976452708244324, + "learning_rate": 0.00013384956622874001, + "loss": 0.23584742546081544, + "mean_token_accuracy": 0.9216851457953453, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.37913159246361533, + "eval_loss": 0.6057604551315308, + "eval_mean_token_accuracy": 0.8525801203971686, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.1145, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 2000 + }, + { + "entropy": 0.27438195240803254, + "epoch": 5.024906600249066, + "grad_norm": 0.6729586124420166, + "learning_rate": 0.0001319149012229075, + "loss": 0.19775952100753785, + "mean_token_accuracy": 0.9339428559327737, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.3448961910813354, + "eval_loss": 0.6750120520591736, + "eval_mean_token_accuracy": 0.8487970232963562, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.1169, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 2020 + }, + { + "entropy": 0.21423916313797237, + "epoch": 5.074719800747198, + "grad_norm": 0.6934391856193542, + "learning_rate": 0.00012997457388105022, + "loss": 0.1439570426940918, + "mean_token_accuracy": 0.9528236843645572, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.3570949243771475, + "eval_loss": 0.6465504169464111, + "eval_mean_token_accuracy": 0.8490785547467166, + "eval_num_tokens": 4763269.0, + "eval_runtime": 85.9574, + "eval_samples_per_second": 15.996, + "eval_steps_per_second": 2.001, + "step": 2040 + }, + { + "entropy": 0.20838565267622472, + "epoch": 5.12453300124533, + "grad_norm": 0.7286986112594604, + "learning_rate": 0.00012802916937942972, + "loss": 0.14467307329177856, + "mean_token_accuracy": 0.950994835793972, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.3452463157821533, + "eval_loss": 0.6705958843231201, + "eval_mean_token_accuracy": 0.8490352796953778, + "eval_num_tokens": 4809047.0, + "eval_runtime": 86.228, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 2060 + }, + { + "entropy": 0.20453082229942082, + "epoch": 5.174346201743462, + "grad_norm": 0.7515555620193481, + "learning_rate": 0.00012607927442550974, + "loss": 0.13732000589370727, + "mean_token_accuracy": 0.9537357829511166, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.32431264914745506, + "eval_loss": 0.6743043065071106, + "eval_mean_token_accuracy": 0.8504878629085629, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.5948, + "eval_samples_per_second": 15.879, + "eval_steps_per_second": 1.986, + "step": 2080 + }, + { + "entropy": 0.21812320686876774, + "epoch": 5.224159402241594, + "grad_norm": 0.9093465209007263, + "learning_rate": 0.0001241254770810132, + "loss": 0.14311420917510986, + "mean_token_accuracy": 0.9514068141579628, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.33086285835435225, + "eval_loss": 0.6676449179649353, + "eval_mean_token_accuracy": 0.8505287662495015, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 2100 + }, + { + "entropy": 0.2180163251236081, + "epoch": 5.273972602739726, + "grad_norm": 0.6703007221221924, + "learning_rate": 0.00012216836658457075, + "loss": 0.14803968667984008, + "mean_token_accuracy": 0.9521303348243236, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.33162341708707255, + "eval_loss": 0.6658875942230225, + "eval_mean_token_accuracy": 0.8500757605530495, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.6296, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 2120 + }, + { + "entropy": 0.22511130161583423, + "epoch": 5.323785803237858, + "grad_norm": 0.8078880906105042, + "learning_rate": 0.00012020853317401455, + "loss": 0.15228408575057983, + "mean_token_accuracy": 0.947144789993763, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3354601170434508, + "eval_loss": 0.6677829623222351, + "eval_mean_token_accuracy": 0.8482600024273229, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.4689, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.989, + "step": 2140 + }, + { + "entropy": 0.2244176059961319, + "epoch": 5.37359900373599, + "grad_norm": 0.9636075496673584, + "learning_rate": 0.00011824656790837037, + "loss": 0.15260883569717407, + "mean_token_accuracy": 0.9471467643976211, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.3381616926297199, + "eval_loss": 0.6694412231445312, + "eval_mean_token_accuracy": 0.8482369603805764, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.4147, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 2160 + }, + { + "entropy": 0.22982364390045404, + "epoch": 5.423412204234122, + "grad_norm": 0.775401771068573, + "learning_rate": 0.00011628306248960262, + "loss": 0.15140302181243898, + "mean_token_accuracy": 0.9492553934454918, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.3305150235808173, + "eval_loss": 0.6717822551727295, + "eval_mean_token_accuracy": 0.8489849723355715, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.4728, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.989, + "step": 2180 + }, + { + "entropy": 0.21448935717344284, + "epoch": 5.473225404732254, + "grad_norm": 0.6575281023979187, + "learning_rate": 0.00011431860908416465, + "loss": 0.1452319622039795, + "mean_token_accuracy": 0.9505287684500218, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3488145174328671, + "eval_loss": 0.6612305641174316, + "eval_mean_token_accuracy": 0.8492907808963642, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6927, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 2200 + }, + { + "entropy": 0.23091202937066554, + "epoch": 5.523038605230386, + "grad_norm": 0.8909686207771301, + "learning_rate": 0.00011235380014440985, + "loss": 0.15150139331817628, + "mean_token_accuracy": 0.9497875183820724, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.3268539015810157, + "eval_loss": 0.6667542457580566, + "eval_mean_token_accuracy": 0.8499062903398691, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.4644, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 2220 + }, + { + "entropy": 0.2227974807843566, + "epoch": 5.572851805728518, + "grad_norm": 0.6180275082588196, + "learning_rate": 0.0001103892282299158, + "loss": 0.1491069197654724, + "mean_token_accuracy": 0.9488144010305405, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3346347655494546, + "eval_loss": 0.6665948629379272, + "eval_mean_token_accuracy": 0.8499961893918903, + "eval_num_tokens": 5226864.0, + "eval_runtime": 87.0548, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.976, + "step": 2240 + }, + { + "entropy": 0.21368421968072654, + "epoch": 5.62266500622665, + "grad_norm": 0.6004369258880615, + "learning_rate": 0.00010842548582877651, + "loss": 0.14485255479812623, + "mean_token_accuracy": 0.9502056457102299, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.32753298804163933, + "eval_loss": 0.6680151224136353, + "eval_mean_token_accuracy": 0.8515451086121936, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.8524, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.98, + "step": 2260 + }, + { + "entropy": 0.2103635374456644, + "epoch": 5.672478206724782, + "grad_norm": 0.699174702167511, + "learning_rate": 0.00010646316517891613, + "loss": 0.14297772645950318, + "mean_token_accuracy": 0.9512537539005279, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.32966585959806, + "eval_loss": 0.675578773021698, + "eval_mean_token_accuracy": 0.8509623023659684, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.4518, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.99, + "step": 2280 + }, + { + "entropy": 0.22516900151968003, + "epoch": 5.722291407222914, + "grad_norm": 0.6637354493141174, + "learning_rate": 0.00010450285808947797, + "loss": 0.15202572345733642, + "mean_token_accuracy": 0.9482452072203159, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3369456917740578, + "eval_loss": 0.6697061061859131, + "eval_mean_token_accuracy": 0.848603522361711, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.6371, + "eval_samples_per_second": 15.871, + "eval_steps_per_second": 1.985, + "step": 2300 + }, + { + "entropy": 0.21841065725311637, + "epoch": 5.772104607721046, + "grad_norm": 0.7940268516540527, + "learning_rate": 0.00010254515576234297, + "loss": 0.14710167646408082, + "mean_token_accuracy": 0.9493498183786869, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3237486180177955, + "eval_loss": 0.6779657602310181, + "eval_mean_token_accuracy": 0.8500715313955794, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.1826, + "eval_samples_per_second": 15.954, + "eval_steps_per_second": 1.996, + "step": 2320 + }, + { + "entropy": 0.22146204356104135, + "epoch": 5.821917808219178, + "grad_norm": 0.9234833121299744, + "learning_rate": 0.00010059064861383132, + "loss": 0.14720046520233154, + "mean_token_accuracy": 0.9493872679769992, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.32365207564692167, + "eval_loss": 0.6704005002975464, + "eval_mean_token_accuracy": 0.8507985760306203, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.5494, + "eval_samples_per_second": 15.887, + "eval_steps_per_second": 1.987, + "step": 2340 + }, + { + "entropy": 0.20934011954814197, + "epoch": 5.87173100871731, + "grad_norm": 0.5547503232955933, + "learning_rate": 9.863992609664084e-05, + "loss": 0.1464867353439331, + "mean_token_accuracy": 0.9503875687718392, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.3330401429083458, + "eval_loss": 0.6659091114997864, + "eval_mean_token_accuracy": 0.8504848906467127, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.5855, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 2360 + }, + { + "entropy": 0.21678635366261007, + "epoch": 5.921544209215442, + "grad_norm": 0.570612907409668, + "learning_rate": 9.669357652207635e-05, + "loss": 0.14821385145187377, + "mean_token_accuracy": 0.9503940217196941, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3322022325077722, + "eval_loss": 0.6722489595413208, + "eval_mean_token_accuracy": 0.8489979422369669, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.2986, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 2380 + }, + { + "entropy": 0.20932920072227718, + "epoch": 5.971357409713574, + "grad_norm": 0.7879557609558105, + "learning_rate": 9.475218688262262e-05, + "loss": 0.14675841331481934, + "mean_token_accuracy": 0.9507176131010056, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.3199348642902319, + "eval_loss": 0.6698136329650879, + "eval_mean_token_accuracy": 0.8514142130003419, + "eval_num_tokens": 5605400.0, + "eval_runtime": 85.8995, + "eval_samples_per_second": 16.007, + "eval_steps_per_second": 2.002, + "step": 2400 + }, + { + "entropy": 0.21032143919131693, + "epoch": 6.019925280199253, + "grad_norm": 0.5823076367378235, + "learning_rate": 9.281634267491569e-05, + "loss": 0.13322267532348633, + "mean_token_accuracy": 0.9550939072401096, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.30206270117399303, + "eval_loss": 0.7093168497085571, + "eval_mean_token_accuracy": 0.8500627639681794, + "eval_num_tokens": 5648968.0, + "eval_runtime": 85.8128, + "eval_samples_per_second": 16.023, + "eval_steps_per_second": 2.004, + "step": 2420 + }, + { + "entropy": 0.1534628233872354, + "epoch": 6.069738480697385, + "grad_norm": 0.710133969783783, + "learning_rate": 9.088662772316508e-05, + "loss": 0.09078952670097351, + "mean_token_accuracy": 0.9678447999060154, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.28208133101809857, + "eval_loss": 0.7636417150497437, + "eval_mean_token_accuracy": 0.8494061477655588, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9724, + "eval_samples_per_second": 15.994, + "eval_steps_per_second": 2.001, + "step": 2440 + }, + { + "entropy": 0.16151462448760867, + "epoch": 6.119551681195516, + "grad_norm": 0.5793812274932861, + "learning_rate": 8.896362400308028e-05, + "loss": 0.09545697569847107, + "mean_token_accuracy": 0.9671573750674725, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.2833245605403601, + "eval_loss": 0.7402405738830566, + "eval_mean_token_accuracy": 0.8503523728875226, + "eval_num_tokens": 5745090.0, + "eval_runtime": 85.5461, + "eval_samples_per_second": 16.073, + "eval_steps_per_second": 2.011, + "step": 2460 + }, + { + "entropy": 0.15203177919611335, + "epoch": 6.169364881693649, + "grad_norm": 0.4251123368740082, + "learning_rate": 8.704791146635483e-05, + "loss": 0.09420782327651978, + "mean_token_accuracy": 0.9677386932075024, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.28572545962971313, + "eval_loss": 0.735416829586029, + "eval_mean_token_accuracy": 0.8487084663884584, + "eval_num_tokens": 5790333.0, + "eval_runtime": 85.4801, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.012, + "step": 2480 + }, + { + "entropy": 0.15587336672469973, + "epoch": 6.219178082191781, + "grad_norm": 0.4357028007507324, + "learning_rate": 8.514006786576085e-05, + "loss": 0.09429320096969604, + "mean_token_accuracy": 0.9682952925562859, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.2859006894882335, + "eval_loss": 0.7347224950790405, + "eval_mean_token_accuracy": 0.8501905518215757, + "eval_num_tokens": 5837321.0, + "eval_runtime": 85.7578, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.006, + "step": 2500 + }, + { + "entropy": 0.15765639198943973, + "epoch": 6.268991282689913, + "grad_norm": 0.47331130504608154, + "learning_rate": 8.324066858090663e-05, + "loss": 0.09571113586425781, + "mean_token_accuracy": 0.9683481335639954, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.29231513846059176, + "eval_loss": 0.7392512559890747, + "eval_mean_token_accuracy": 0.8486633983462356, + "eval_num_tokens": 5884398.0, + "eval_runtime": 85.7846, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.005, + "step": 2520 + }, + { + "entropy": 0.16176860257983208, + "epoch": 6.318804483188045, + "grad_norm": 0.6142018437385559, + "learning_rate": 8.135028644470992e-05, + "loss": 0.09486144185066223, + "mean_token_accuracy": 0.9682316601276397, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.2851274753379267, + "eval_loss": 0.7520816922187805, + "eval_mean_token_accuracy": 0.8501113649717597, + "eval_num_tokens": 5929876.0, + "eval_runtime": 85.9425, + "eval_samples_per_second": 15.999, + "eval_steps_per_second": 2.001, + "step": 2540 + }, + { + "entropy": 0.15404034564271568, + "epoch": 6.3686176836861765, + "grad_norm": 0.6051287651062012, + "learning_rate": 7.946949157063964e-05, + "loss": 0.09280472993850708, + "mean_token_accuracy": 0.9684635892510414, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28802703563557114, + "eval_loss": 0.7439162135124207, + "eval_mean_token_accuracy": 0.8499851770872293, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.0703, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.998, + "step": 2560 + }, + { + "entropy": 0.15343588953837753, + "epoch": 6.418430884184309, + "grad_norm": 0.4823743402957916, + "learning_rate": 7.759885118077701e-05, + "loss": 0.09000591039657593, + "mean_token_accuracy": 0.9699928767979145, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2795634938533916, + "eval_loss": 0.7647850513458252, + "eval_mean_token_accuracy": 0.8503464397995971, + "eval_num_tokens": 6025380.0, + "eval_runtime": 85.8886, + "eval_samples_per_second": 16.009, + "eval_steps_per_second": 2.003, + "step": 2580 + }, + { + "entropy": 0.15740026142448188, + "epoch": 6.468244084682441, + "grad_norm": 0.5082696676254272, + "learning_rate": 7.57389294347494e-05, + "loss": 0.09191849827766418, + "mean_token_accuracy": 0.9692809768021107, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2913342311458532, + "eval_loss": 0.7518694996833801, + "eval_mean_token_accuracy": 0.8483168302580367, + "eval_num_tokens": 6073349.0, + "eval_runtime": 85.5761, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.01, + "step": 2600 + }, + { + "entropy": 0.15922069251537324, + "epoch": 6.518057285180573, + "grad_norm": 0.3995199501514435, + "learning_rate": 7.389028725958736e-05, + "loss": 0.09584367871284485, + "mean_token_accuracy": 0.9685114495456218, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.2863075934177221, + "eval_loss": 0.7539381384849548, + "eval_mean_token_accuracy": 0.8507507083027862, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.112, + "eval_samples_per_second": 15.968, + "eval_steps_per_second": 1.997, + "step": 2620 + }, + { + "entropy": 0.16197575423866512, + "epoch": 6.567870485678705, + "grad_norm": 0.534295380115509, + "learning_rate": 7.205348218055678e-05, + "loss": 0.0961170256137848, + "mean_token_accuracy": 0.9674530044198036, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.29021967315050057, + "eval_loss": 0.751198947429657, + "eval_mean_token_accuracy": 0.8509796344956686, + "eval_num_tokens": 6165523.0, + "eval_runtime": 85.7958, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.005, + "step": 2640 + }, + { + "entropy": 0.15261746793985367, + "epoch": 6.617683686176837, + "grad_norm": 0.5391237139701843, + "learning_rate": 7.022906815301673e-05, + "loss": 0.0926026999950409, + "mean_token_accuracy": 0.9695659473538398, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.29128045216202736, + "eval_loss": 0.7450292110443115, + "eval_mean_token_accuracy": 0.8498771443616512, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.3963, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 2660 + }, + { + "entropy": 0.16164180357009172, + "epoch": 6.667496886674969, + "grad_norm": 0.5767946243286133, + "learning_rate": 6.841759539535419e-05, + "loss": 0.09291981458663941, + "mean_token_accuracy": 0.9687136687338352, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2897637223088464, + "eval_loss": 0.7503410577774048, + "eval_mean_token_accuracy": 0.8503315164599308, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.0653, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.998, + "step": 2680 + }, + { + "entropy": 0.17062523355707526, + "epoch": 6.717310087173101, + "grad_norm": 0.4974168539047241, + "learning_rate": 6.661961022304563e-05, + "loss": 0.09713236689567566, + "mean_token_accuracy": 0.9661971725523472, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2765843396963075, + "eval_loss": 0.7604002356529236, + "eval_mean_token_accuracy": 0.8521115277395692, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.1676, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 2700 + }, + { + "entropy": 0.17544092936441302, + "epoch": 6.767123287671232, + "grad_norm": 0.5523537993431091, + "learning_rate": 6.483565488389582e-05, + "loss": 0.09709116220474243, + "mean_token_accuracy": 0.9650957375764847, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.27939334659035814, + "eval_loss": 0.7534670829772949, + "eval_mean_token_accuracy": 0.851230604010959, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.2913, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 2720 + }, + { + "entropy": 0.15991022661328316, + "epoch": 6.816936488169365, + "grad_norm": 0.478551983833313, + "learning_rate": 6.306626739450311e-05, + "loss": 0.09564646482467651, + "mean_token_accuracy": 0.9679084822535515, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.27878295491601146, + "eval_loss": 0.7519959211349487, + "eval_mean_token_accuracy": 0.8510654949864676, + "eval_num_tokens": 6397720.0, + "eval_runtime": 85.9109, + "eval_samples_per_second": 16.005, + "eval_steps_per_second": 2.002, + "step": 2740 + }, + { + "entropy": 0.16824879590421915, + "epoch": 6.866749688667497, + "grad_norm": 0.6681098937988281, + "learning_rate": 6.131198137800108e-05, + "loss": 0.0962279736995697, + "mean_token_accuracy": 0.966830012947321, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.2834690434121808, + "eval_loss": 0.751922070980072, + "eval_mean_token_accuracy": 0.8521237577809844, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.3618, + "eval_samples_per_second": 15.921, + "eval_steps_per_second": 1.992, + "step": 2760 + }, + { + "entropy": 0.1518704930320382, + "epoch": 6.916562889165629, + "grad_norm": 0.5201290249824524, + "learning_rate": 5.957332590312513e-05, + "loss": 0.09010660648345947, + "mean_token_accuracy": 0.9693463340401649, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.28485129617674404, + "eval_loss": 0.7452457547187805, + "eval_mean_token_accuracy": 0.8512036796919135, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.4524, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.99, + "step": 2780 + }, + { + "entropy": 0.15512610590085388, + "epoch": 6.966376089663761, + "grad_norm": 0.42802050709724426, + "learning_rate": 5.785082532465233e-05, + "loss": 0.09320432543754578, + "mean_token_accuracy": 0.9686134628951549, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.27554594526110693, + "eval_loss": 0.7644653916358948, + "eval_mean_token_accuracy": 0.8513738523389018, + "eval_num_tokens": 6540175.0, + "eval_runtime": 85.7609, + "eval_samples_per_second": 16.033, + "eval_steps_per_second": 2.006, + "step": 2800 + }, + { + "entropy": 0.17524497526196334, + "epoch": 7.01494396014944, + "grad_norm": 0.3330269157886505, + "learning_rate": 5.6144999125263545e-05, + "loss": 0.0895616888999939, + "mean_token_accuracy": 0.9682766932707566, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.2735865569218647, + "eval_loss": 0.768479585647583, + "eval_mean_token_accuracy": 0.8503459383581959, + "eval_num_tokens": 6583767.0, + "eval_runtime": 85.7162, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.007, + "step": 2820 + }, + { + "entropy": 0.1403565663844347, + "epoch": 7.064757160647572, + "grad_norm": 0.35613498091697693, + "learning_rate": 5.4456361758874235e-05, + "loss": 0.07551313638687134, + "mean_token_accuracy": 0.9739301167428493, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.25941789089593775, + "eval_loss": 0.8209511637687683, + "eval_mean_token_accuracy": 0.8505055855873019, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.0943, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 2840 + }, + { + "entropy": 0.13500106502324344, + "epoch": 7.114570361145703, + "grad_norm": 0.34418627619743347, + "learning_rate": 5.2785422495482234e-05, + "loss": 0.07293946146965027, + "mean_token_accuracy": 0.9747208289802074, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.26482899772912954, + "eval_loss": 0.798904538154602, + "eval_mean_token_accuracy": 0.8511530233677044, + "eval_num_tokens": 6672946.0, + "eval_runtime": 85.7915, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.005, + "step": 2860 + }, + { + "entropy": 0.13127502552233636, + "epoch": 7.164383561643835, + "grad_norm": 0.4638441503047943, + "learning_rate": 5.113268526757892e-05, + "loss": 0.07121461629867554, + "mean_token_accuracy": 0.9756786689162255, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2645381211714689, + "eval_loss": 0.809101939201355, + "eval_mean_token_accuracy": 0.8514727898115335, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.84, + "eval_samples_per_second": 16.018, + "eval_steps_per_second": 2.004, + "step": 2880 + }, + { + "entropy": 0.1331390908919275, + "epoch": 7.214196762141968, + "grad_norm": 0.40206775069236755, + "learning_rate": 4.949864851817007e-05, + "loss": 0.07188264131546021, + "mean_token_accuracy": 0.9755406074225903, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.26244733283339544, + "eval_loss": 0.8143188953399658, + "eval_mean_token_accuracy": 0.8514358189909957, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.8546, + "eval_samples_per_second": 16.015, + "eval_steps_per_second": 2.003, + "step": 2900 + }, + { + "entropy": 0.13647331558167936, + "epoch": 7.2640099626401, + "grad_norm": 0.26405787467956543, + "learning_rate": 4.788380505045224e-05, + "loss": 0.07412450313568116, + "mean_token_accuracy": 0.9744274213910102, + "num_tokens": 6809678.0, + "step": 2920 + }, + { + "epoch": 7.2640099626401, + "eval_entropy": 0.2626111418182074, + "eval_loss": 0.8111525177955627, + "eval_mean_token_accuracy": 0.8512121695418691, + "eval_num_tokens": 6809678.0, + "eval_runtime": 85.9626, + "eval_samples_per_second": 15.995, + "eval_steps_per_second": 2.001, + "step": 2920 + }, + { + "entropy": 0.12644002586603165, + "epoch": 7.313823163138232, + "grad_norm": 0.27514681220054626, + "learning_rate": 4.6288641879189884e-05, + "loss": 0.06807711124420165, + "mean_token_accuracy": 0.9760703906416893, + "num_tokens": 6860750.0, + "step": 2940 + }, + { + "epoch": 7.313823163138232, + "eval_entropy": 0.26096762734097106, + "eval_loss": 0.8184595108032227, + "eval_mean_token_accuracy": 0.8501476153384807, + "eval_num_tokens": 6860750.0, + "eval_runtime": 85.9521, + "eval_samples_per_second": 15.997, + "eval_steps_per_second": 2.001, + "step": 2940 + }, + { + "entropy": 0.13920630998909472, + "epoch": 7.363636363636363, + "grad_norm": 0.23584705591201782, + "learning_rate": 4.4713640083838604e-05, + "loss": 0.07301607131958007, + "mean_token_accuracy": 0.9745715200901032, + "num_tokens": 6907092.0, + "step": 2960 + }, + { + "epoch": 7.363636363636363, + "eval_entropy": 0.2612536767021168, + "eval_loss": 0.8116245269775391, + "eval_mean_token_accuracy": 0.8510967350976412, + "eval_num_tokens": 6907092.0, + "eval_runtime": 85.6373, + "eval_samples_per_second": 16.056, + "eval_steps_per_second": 2.008, + "step": 2960 + }, + { + "entropy": 0.1349492883309722, + "epoch": 7.4134495641344955, + "grad_norm": 0.24552719295024872, + "learning_rate": 4.315927466345791e-05, + "loss": 0.07397544980049134, + "mean_token_accuracy": 0.9745095103979111, + "num_tokens": 6952700.0, + "step": 2980 + }, + { + "epoch": 7.4134495641344955, + "eval_entropy": 0.25796533306670744, + "eval_loss": 0.8266491293907166, + "eval_mean_token_accuracy": 0.8511653857868772, + "eval_num_tokens": 6952700.0, + "eval_runtime": 85.7462, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.006, + "step": 2980 + }, + { + "entropy": 0.14479175000451505, + "epoch": 7.463262764632628, + "grad_norm": 0.2846072018146515, + "learning_rate": 4.162601439345814e-05, + "loss": 0.07544798254966736, + "mean_token_accuracy": 0.9727819666266442, + "num_tokens": 6996430.0, + "step": 3000 + }, + { + "epoch": 7.463262764632628, + "eval_entropy": 0.2584348309698493, + "eval_loss": 0.8253348469734192, + "eval_mean_token_accuracy": 0.8511569815319638, + "eval_num_tokens": 6996430.0, + "eval_runtime": 86.2984, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 3000 + }, + { + "entropy": 0.14114196319133043, + "epoch": 7.51307596513076, + "grad_norm": 0.407966285943985, + "learning_rate": 4.011432168422419e-05, + "loss": 0.0736398994922638, + "mean_token_accuracy": 0.9741654269397259, + "num_tokens": 7042038.0, + "step": 3020 + }, + { + "epoch": 7.51307596513076, + "eval_entropy": 0.25232676260693127, + "eval_loss": 0.8296052813529968, + "eval_mean_token_accuracy": 0.8523298349491385, + "eval_num_tokens": 7042038.0, + "eval_runtime": 85.8445, + "eval_samples_per_second": 16.017, + "eval_steps_per_second": 2.004, + "step": 3020 + }, + { + "entropy": 0.1353456223383546, + "epoch": 7.562889165628892, + "grad_norm": 0.2712634801864624, + "learning_rate": 3.8624652441658684e-05, + "loss": 0.07362412214279175, + "mean_token_accuracy": 0.9747945807874203, + "num_tokens": 7089390.0, + "step": 3040 + }, + { + "epoch": 7.562889165628892, + "eval_entropy": 0.2579477243991785, + "eval_loss": 0.8274564743041992, + "eval_mean_token_accuracy": 0.8517705212498821, + "eval_num_tokens": 7089390.0, + "eval_runtime": 85.8222, + "eval_samples_per_second": 16.022, + "eval_steps_per_second": 2.004, + "step": 3040 + }, + { + "entropy": 0.1296080862637609, + "epoch": 7.6127023661270234, + "grad_norm": 0.2371893972158432, + "learning_rate": 3.715745592968707e-05, + "loss": 0.06971035599708557, + "mean_token_accuracy": 0.9759043246507645, + "num_tokens": 7138002.0, + "step": 3060 + }, + { + "epoch": 7.6127023661270234, + "eval_entropy": 0.25391967083479083, + "eval_loss": 0.8197130560874939, + "eval_mean_token_accuracy": 0.8522267875283264, + "eval_num_tokens": 7138002.0, + "eval_runtime": 85.8796, + "eval_samples_per_second": 16.011, + "eval_steps_per_second": 2.003, + "step": 3060 + }, + { + "entropy": 0.1311203008517623, + "epoch": 7.662515566625156, + "grad_norm": 0.22499267756938934, + "learning_rate": 3.5713174634765967e-05, + "loss": 0.07176244258880615, + "mean_token_accuracy": 0.9754939571022987, + "num_tokens": 7185520.0, + "step": 3080 + }, + { + "epoch": 7.662515566625156, + "eval_entropy": 0.2526215241225653, + "eval_loss": 0.8265154361724854, + "eval_mean_token_accuracy": 0.8519952584837758, + "eval_num_tokens": 7185520.0, + "eval_runtime": 85.8746, + "eval_samples_per_second": 16.012, + "eval_steps_per_second": 2.003, + "step": 3080 + }, + { + "entropy": 0.13420484317466616, + "epoch": 7.712328767123288, + "grad_norm": 0.2398064285516739, + "learning_rate": 3.4292244132434866e-05, + "loss": 0.07559212446212768, + "mean_token_accuracy": 0.9743142127990723, + "num_tokens": 7232170.0, + "step": 3100 + }, + { + "epoch": 7.712328767123288, + "eval_entropy": 0.2484562756537005, + "eval_loss": 0.8312150239944458, + "eval_mean_token_accuracy": 0.8528405119513356, + "eval_num_tokens": 7232170.0, + "eval_runtime": 85.7896, + "eval_samples_per_second": 16.028, + "eval_steps_per_second": 2.005, + "step": 3100 + }, + { + "entropy": 0.11965563679113984, + "epoch": 7.76214196762142, + "grad_norm": 0.3408384919166565, + "learning_rate": 3.2895092955952746e-05, + "loss": 0.0661750853061676, + "mean_token_accuracy": 0.9776600524783134, + "num_tokens": 7282846.0, + "step": 3120 + }, + { + "epoch": 7.76214196762142, + "eval_entropy": 0.2522421533804993, + "eval_loss": 0.8327009677886963, + "eval_mean_token_accuracy": 0.8524222023958383, + "eval_num_tokens": 7282846.0, + "eval_runtime": 86.1769, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 1.996, + "step": 3120 + }, + { + "entropy": 0.13388084415346385, + "epoch": 7.811955168119551, + "grad_norm": 0.35418516397476196, + "learning_rate": 3.152214246705829e-05, + "loss": 0.07149899601936341, + "mean_token_accuracy": 0.9747635535895824, + "num_tokens": 7331518.0, + "step": 3140 + }, + { + "epoch": 7.811955168119551, + "eval_entropy": 0.25038352296795957, + "eval_loss": 0.836457371711731, + "eval_mean_token_accuracy": 0.8526130665180295, + "eval_num_tokens": 7331518.0, + "eval_runtime": 85.6099, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.009, + "step": 3140 + }, + { + "entropy": 0.13530643959529698, + "epoch": 7.861768368617684, + "grad_norm": 0.38060539960861206, + "learning_rate": 3.017380672889291e-05, + "loss": 0.07116585969924927, + "mean_token_accuracy": 0.973284512758255, + "num_tokens": 7379056.0, + "step": 3160 + }, + { + "epoch": 7.861768368617684, + "eval_entropy": 0.255092611319797, + "eval_loss": 0.8314701914787292, + "eval_mean_token_accuracy": 0.8520913099826768, + "eval_num_tokens": 7379056.0, + "eval_runtime": 85.877, + "eval_samples_per_second": 16.011, + "eval_steps_per_second": 2.003, + "step": 3160 + }, + { + "entropy": 0.13383390177041293, + "epoch": 7.911581569115816, + "grad_norm": 0.3827536106109619, + "learning_rate": 2.8850492381124808e-05, + "loss": 0.07305437326431274, + "mean_token_accuracy": 0.9750778004527092, + "num_tokens": 7424770.0, + "step": 3180 + }, + { + "epoch": 7.911581569115816, + "eval_entropy": 0.25416371157003004, + "eval_loss": 0.8206402063369751, + "eval_mean_token_accuracy": 0.852779901651449, + "eval_num_tokens": 7424770.0, + "eval_runtime": 86.1015, + "eval_samples_per_second": 15.97, + "eval_steps_per_second": 1.998, + "step": 3180 + }, + { + "entropy": 0.1395680439658463, + "epoch": 7.961394769613948, + "grad_norm": 0.3809775412082672, + "learning_rate": 2.7552598517312256e-05, + "loss": 0.07236042022705078, + "mean_token_accuracy": 0.9731538116931915, + "num_tokens": 7470804.0, + "step": 3200 + }, + { + "epoch": 7.961394769613948, + "eval_entropy": 0.25528111975899964, + "eval_loss": 0.8230037093162537, + "eval_mean_token_accuracy": 0.8526452603035195, + "eval_num_tokens": 7470804.0, + "eval_runtime": 85.7895, + "eval_samples_per_second": 16.028, + "eval_steps_per_second": 2.005, + "step": 3200 + }, + { + "entropy": 0.12193699864049752, + "epoch": 8.009962640099626, + "grad_norm": 0.11854425817728043, + "learning_rate": 2.6280516564542205e-05, + "loss": 0.06617764234542847, + "mean_token_accuracy": 0.977179691577569, + "num_tokens": 7518110.0, + "step": 3220 + }, + { + "epoch": 8.009962640099626, + "eval_entropy": 0.25100527677771656, + "eval_loss": 0.8393343687057495, + "eval_mean_token_accuracy": 0.8522553132023922, + "eval_num_tokens": 7518110.0, + "eval_runtime": 85.8837, + "eval_samples_per_second": 16.01, + "eval_steps_per_second": 2.003, + "step": 3220 + }, + { + "entropy": 0.12788885813206435, + "epoch": 8.059775840597759, + "grad_norm": 0.16094881296157837, + "learning_rate": 2.50346301653812e-05, + "loss": 0.06274186968803405, + "mean_token_accuracy": 0.9766994707286358, + "num_tokens": 7565539.0, + "step": 3240 + }, + { + "epoch": 8.059775840597759, + "eval_entropy": 0.24409458682287571, + "eval_loss": 0.874617338180542, + "eval_mean_token_accuracy": 0.8521041180505309, + "eval_num_tokens": 7565539.0, + "eval_runtime": 86.2656, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 3240 + }, + { + "entropy": 0.12464155335910618, + "epoch": 8.10958904109589, + "grad_norm": 0.16893954575061798, + "learning_rate": 2.381531506217437e-05, + "loss": 0.06093020439147949, + "mean_token_accuracy": 0.9776258453726768, + "num_tokens": 7612578.0, + "step": 3260 + }, + { + "epoch": 8.10958904109589, + "eval_entropy": 0.24396493017326953, + "eval_loss": 0.891161322593689, + "eval_mean_token_accuracy": 0.8515338024427724, + "eval_num_tokens": 7612578.0, + "eval_runtime": 85.9061, + "eval_samples_per_second": 16.006, + "eval_steps_per_second": 2.002, + "step": 3260 + }, + { + "entropy": 0.12345920228399336, + "epoch": 8.159402241594023, + "grad_norm": 0.14332273602485657, + "learning_rate": 2.262293898372616e-05, + "loss": 0.061289966106414795, + "mean_token_accuracy": 0.9762230902910233, + "num_tokens": 7660157.0, + "step": 3280 + }, + { + "epoch": 8.159402241594023, + "eval_entropy": 0.2481445314059424, + "eval_loss": 0.8922848105430603, + "eval_mean_token_accuracy": 0.8514944855556932, + "eval_num_tokens": 7660157.0, + "eval_runtime": 85.5201, + "eval_samples_per_second": 16.078, + "eval_steps_per_second": 2.011, + "step": 3280 + }, + { + "entropy": 0.12298110066913068, + "epoch": 8.209215442092155, + "grad_norm": 0.21848882734775543, + "learning_rate": 2.1457861534398633e-05, + "loss": 0.05986443758010864, + "mean_token_accuracy": 0.9786281704902648, + "num_tokens": 7709745.0, + "step": 3300 + }, + { + "epoch": 8.209215442092155, + "eval_entropy": 0.24329388124305149, + "eval_loss": 0.9021085500717163, + "eval_mean_token_accuracy": 0.8521762625422589, + "eval_num_tokens": 7709745.0, + "eval_runtime": 85.955, + "eval_samples_per_second": 15.997, + "eval_steps_per_second": 2.001, + "step": 3300 + }, + { + "entropy": 0.13265180448070168, + "epoch": 8.259028642590286, + "grad_norm": 0.18067947030067444, + "learning_rate": 2.0320434085659692e-05, + "loss": 0.06724961400032044, + "mean_token_accuracy": 0.975098168104887, + "num_tokens": 7753571.0, + "step": 3320 + }, + { + "epoch": 8.259028642590286, + "eval_entropy": 0.2433211464694766, + "eval_loss": 0.9094350337982178, + "eval_mean_token_accuracy": 0.8520150094531304, + "eval_num_tokens": 7753571.0, + "eval_runtime": 85.7989, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.005, + "step": 3320 + }, + { + "entropy": 0.11949320202693343, + "epoch": 8.308841843088418, + "grad_norm": 0.17020289599895477, + "learning_rate": 1.9210999670114196e-05, + "loss": 0.0634455680847168, + "mean_token_accuracy": 0.9771294385194779, + "num_tokens": 7799310.0, + "step": 3340 + }, + { + "epoch": 8.308841843088418, + "eval_entropy": 0.24345201219237128, + "eval_loss": 0.9021793603897095, + "eval_mean_token_accuracy": 0.8520745697409607, + "eval_num_tokens": 7799310.0, + "eval_runtime": 86.0883, + "eval_samples_per_second": 15.972, + "eval_steps_per_second": 1.998, + "step": 3340 + }, + { + "entropy": 0.12065747743472457, + "epoch": 8.35865504358655, + "grad_norm": 0.16789060831069946, + "learning_rate": 1.8129892878049886e-05, + "loss": 0.061494195461273195, + "mean_token_accuracy": 0.9779584899544715, + "num_tokens": 7846447.0, + "step": 3360 + }, + { + "epoch": 8.35865504358655, + "eval_entropy": 0.24093415042342142, + "eval_loss": 0.9006755352020264, + "eval_mean_token_accuracy": 0.852174230786257, + "eval_num_tokens": 7846447.0, + "eval_runtime": 85.9011, + "eval_samples_per_second": 16.007, + "eval_steps_per_second": 2.002, + "step": 3360 + }, + { + "entropy": 0.13125578537583352, + "epoch": 8.408468244084682, + "grad_norm": 0.1662452220916748, + "learning_rate": 1.70774397565298e-05, + "loss": 0.06685600876808166, + "mean_token_accuracy": 0.9744067586958408, + "num_tokens": 7890283.0, + "step": 3380 + }, + { + "epoch": 8.408468244084682, + "eval_entropy": 0.24062153688350388, + "eval_loss": 0.9078915119171143, + "eval_mean_token_accuracy": 0.8523201647886011, + "eval_num_tokens": 7890283.0, + "eval_runtime": 86.0201, + "eval_samples_per_second": 15.985, + "eval_steps_per_second": 2.0, + "step": 3380 + }, + { + "entropy": 0.11986117120832204, + "epoch": 8.458281444582815, + "grad_norm": 0.19571948051452637, + "learning_rate": 1.6053957711060606e-05, + "loss": 0.06411095261573792, + "mean_token_accuracy": 0.9770627245306969, + "num_tokens": 7936518.0, + "step": 3400 + }, + { + "epoch": 8.458281444582815, + "eval_entropy": 0.24352820347561394, + "eval_loss": 0.9058943390846252, + "eval_mean_token_accuracy": 0.8519382792156797, + "eval_num_tokens": 7936518.0, + "eval_runtime": 85.966, + "eval_samples_per_second": 15.995, + "eval_steps_per_second": 2.001, + "step": 3400 + }, + { + "entropy": 0.12857897616922856, + "epoch": 8.508094645080947, + "grad_norm": 0.2609264850616455, + "learning_rate": 1.5059755409867613e-05, + "loss": 0.06473397612571716, + "mean_token_accuracy": 0.9764650195837021, + "num_tokens": 7981966.0, + "step": 3420 + }, + { + "epoch": 8.508094645080947, + "eval_entropy": 0.24032609000108962, + "eval_loss": 0.9077776074409485, + "eval_mean_token_accuracy": 0.8517829197090726, + "eval_num_tokens": 7981966.0, + "eval_runtime": 86.6059, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 3420 + }, + { + "entropy": 0.12348870886489749, + "epoch": 8.557907845579079, + "grad_norm": 0.19537609815597534, + "learning_rate": 1.409513269080473e-05, + "loss": 0.06481348872184753, + "mean_token_accuracy": 0.9769559659063816, + "num_tokens": 8028367.0, + "step": 3440 + }, + { + "epoch": 8.557907845579079, + "eval_entropy": 0.2404322574824788, + "eval_loss": 0.9057720899581909, + "eval_mean_token_accuracy": 0.8521037981953732, + "eval_num_tokens": 8028367.0, + "eval_runtime": 86.166, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.996, + "step": 3440 + }, + { + "entropy": 0.12040232736617326, + "epoch": 8.607721046077211, + "grad_norm": 0.3310582935810089, + "learning_rate": 1.3160380470927183e-05, + "loss": 0.06468871235847473, + "mean_token_accuracy": 0.9768650442361831, + "num_tokens": 8074934.0, + "step": 3460 + }, + { + "epoch": 8.607721046077211, + "eval_entropy": 0.24118655876711356, + "eval_loss": 0.9028318524360657, + "eval_mean_token_accuracy": 0.8521025340224422, + "eval_num_tokens": 8074934.0, + "eval_runtime": 85.3668, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.015, + "step": 3460 + }, + { + "entropy": 0.12328103906475008, + "epoch": 8.657534246575342, + "grad_norm": 0.12836167216300964, + "learning_rate": 1.2255780658755122e-05, + "loss": 0.06229386329650879, + "mean_token_accuracy": 0.9763277888298034, + "num_tokens": 8122775.0, + "step": 3480 + }, + { + "epoch": 8.657534246575342, + "eval_entropy": 0.24194598145956217, + "eval_loss": 0.9009329080581665, + "eval_mean_token_accuracy": 0.8521693289973015, + "eval_num_tokens": 8122775.0, + "eval_runtime": 85.9415, + "eval_samples_per_second": 15.999, + "eval_steps_per_second": 2.001, + "step": 3480 + }, + { + "entropy": 0.11321646976284683, + "epoch": 8.707347447073474, + "grad_norm": 0.15656894445419312, + "learning_rate": 1.1381606069253786e-05, + "loss": 0.05908188819885254, + "mean_token_accuracy": 0.9779504477977753, + "num_tokens": 8174307.0, + "step": 3500 + }, + { + "epoch": 8.707347447073474, + "eval_entropy": 0.24121542517528977, + "eval_loss": 0.9016091823577881, + "eval_mean_token_accuracy": 0.8521790667328724, + "eval_num_tokens": 8174307.0, + "eval_runtime": 85.7465, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.006, + "step": 3500 + }, + { + "entropy": 0.12657046681270004, + "epoch": 8.757160647571606, + "grad_norm": 0.22597502171993256, + "learning_rate": 1.053812034155629e-05, + "loss": 0.06244581937789917, + "mean_token_accuracy": 0.976795207709074, + "num_tokens": 8222808.0, + "step": 3520 + }, + { + "epoch": 8.757160647571606, + "eval_entropy": 0.23877542708502258, + "eval_loss": 0.9069110155105591, + "eval_mean_token_accuracy": 0.8522880177858264, + "eval_num_tokens": 8222808.0, + "eval_runtime": 85.7792, + "eval_samples_per_second": 16.03, + "eval_steps_per_second": 2.005, + "step": 3520 + }, + { + "entropy": 0.11422101808711886, + "epoch": 8.806973848069738, + "grad_norm": 0.21139323711395264, + "learning_rate": 9.725577859453502e-06, + "loss": 0.05988085865974426, + "mean_token_accuracy": 0.9779510758817196, + "num_tokens": 8273335.0, + "step": 3540 + }, + { + "epoch": 8.806973848069738, + "eval_entropy": 0.2393161087881687, + "eval_loss": 0.9033801555633545, + "eval_mean_token_accuracy": 0.8522614209457885, + "eval_num_tokens": 8273335.0, + "eval_runtime": 85.5594, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 3540 + }, + { + "entropy": 0.13810604228638113, + "epoch": 8.85678704856787, + "grad_norm": 0.24571993947029114, + "learning_rate": 8.944223674675537e-06, + "loss": 0.07036117911338806, + "mean_token_accuracy": 0.9734892748296261, + "num_tokens": 8315235.0, + "step": 3560 + }, + { + "epoch": 8.85678704856787, + "eval_entropy": 0.23998506947658782, + "eval_loss": 0.9009848833084106, + "eval_mean_token_accuracy": 0.8521793619837872, + "eval_num_tokens": 8315235.0, + "eval_runtime": 86.0974, + "eval_samples_per_second": 15.97, + "eval_steps_per_second": 1.998, + "step": 3560 + }, + { + "entropy": 0.14193559321574867, + "epoch": 8.906600249066003, + "grad_norm": 0.17304112017154694, + "learning_rate": 8.194293432987386e-06, + "loss": 0.07077967524528503, + "mean_token_accuracy": 0.973305893689394, + "num_tokens": 8358099.0, + "step": 3580 + }, + { + "epoch": 8.906600249066003, + "eval_entropy": 0.23883876689644748, + "eval_loss": 0.9015622138977051, + "eval_mean_token_accuracy": 0.8524864378363587, + "eval_num_tokens": 8358099.0, + "eval_runtime": 86.0089, + "eval_samples_per_second": 15.987, + "eval_steps_per_second": 2.0, + "step": 3580 + }, + { + "entropy": 0.11878943420015275, + "epoch": 8.956413449564135, + "grad_norm": 0.19075658917427063, + "learning_rate": 7.476013303121426e-06, + "loss": 0.060806107521057126, + "mean_token_accuracy": 0.9776863709092141, + "num_tokens": 8407430.0, + "step": 3600 + }, + { + "epoch": 8.956413449564135, + "eval_entropy": 0.23726526309931, + "eval_loss": 0.9060276746749878, + "eval_mean_token_accuracy": 0.8524192058762838, + "eval_num_tokens": 8407430.0, + "eval_runtime": 85.7252, + "eval_samples_per_second": 16.04, + "eval_steps_per_second": 2.006, + "step": 3600 + }, + { + "entropy": 0.1255835090787747, + "epoch": 9.004981320049813, + "grad_norm": 0.11608047038316727, + "learning_rate": 6.78959990856799e-06, + "loss": 0.06319612860679627, + "mean_token_accuracy": 0.9766685519462976, + "num_tokens": 8453175.0, + "step": 3620 + }, + { + "epoch": 9.004981320049813, + "eval_entropy": 0.2373251837006835, + "eval_loss": 0.9045722484588623, + "eval_mean_token_accuracy": 0.8525558363559634, + "eval_num_tokens": 8453175.0, + "eval_runtime": 85.7435, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.006, + "step": 3620 + }, + { + "entropy": 0.12587778437882663, + "epoch": 9.054794520547945, + "grad_norm": 0.1564614623785019, + "learning_rate": 6.135260262244683e-06, + "loss": 0.0630365788936615, + "mean_token_accuracy": 0.9777486085891723, + "num_tokens": 8497151.0, + "step": 3640 + }, + { + "epoch": 9.054794520547945, + "eval_entropy": 0.23559923721260803, + "eval_loss": 0.9120694398880005, + "eval_mean_token_accuracy": 0.8525292966947999, + "eval_num_tokens": 8497151.0, + "eval_runtime": 85.8018, + "eval_samples_per_second": 16.025, + "eval_steps_per_second": 2.005, + "step": 3640 + }, + { + "entropy": 0.12535365503281354, + "epoch": 9.104607721046078, + "grad_norm": 0.1404249221086502, + "learning_rate": 5.513191704064086e-06, + "loss": 0.060502654314041136, + "mean_token_accuracy": 0.9770058333873749, + "num_tokens": 8542996.0, + "step": 3660 + }, + { + "epoch": 9.104607721046078, + "eval_entropy": 0.23525122691725575, + "eval_loss": 0.9182237982749939, + "eval_mean_token_accuracy": 0.8524098333924316, + "eval_num_tokens": 8542996.0, + "eval_runtime": 85.9872, + "eval_samples_per_second": 15.991, + "eval_steps_per_second": 2.0, + "step": 3660 + }, + { + "entropy": 0.11330419047735632, + "epoch": 9.15442092154421, + "grad_norm": 0.15513843297958374, + "learning_rate": 4.92358184141876e-06, + "loss": 0.05822383761405945, + "mean_token_accuracy": 0.9793384782969952, + "num_tokens": 8591625.0, + "step": 3680 + }, + { + "epoch": 9.15442092154421, + "eval_entropy": 0.2353947116711805, + "eval_loss": 0.9229223132133484, + "eval_mean_token_accuracy": 0.852500357253607, + "eval_num_tokens": 8591625.0, + "eval_runtime": 86.0805, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.998, + "step": 3680 + }, + { + "entropy": 0.11830627010203898, + "epoch": 9.204234122042342, + "grad_norm": 0.1730550080537796, + "learning_rate": 4.366608492601456e-06, + "loss": 0.05860854983329773, + "mean_token_accuracy": 0.9779663667082786, + "num_tokens": 8639845.0, + "step": 3700 + }, + { + "epoch": 9.204234122042342, + "eval_entropy": 0.23567205719476522, + "eval_loss": 0.9269373416900635, + "eval_mean_token_accuracy": 0.8523658004611038, + "eval_num_tokens": 8639845.0, + "eval_runtime": 85.9809, + "eval_samples_per_second": 15.992, + "eval_steps_per_second": 2.0, + "step": 3700 + }, + { + "entropy": 0.1180900705512613, + "epoch": 9.254047322540472, + "grad_norm": 0.20909737050533295, + "learning_rate": 3.842439633177387e-06, + "loss": 0.059438884258270264, + "mean_token_accuracy": 0.9786856278777123, + "num_tokens": 8687194.0, + "step": 3720 + }, + { + "epoch": 9.254047322540472, + "eval_entropy": 0.23602714493524196, + "eval_loss": 0.9293538928031921, + "eval_mean_token_accuracy": 0.8523273440294488, + "eval_num_tokens": 8687194.0, + "eval_runtime": 85.2118, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.019, + "step": 3720 + }, + { + "entropy": 0.13156692241318524, + "epoch": 9.303860523038605, + "grad_norm": 0.12535709142684937, + "learning_rate": 3.3512333453253305e-06, + "loss": 0.06337688565254211, + "mean_token_accuracy": 0.9756712593138218, + "num_tokens": 8731721.0, + "step": 3740 + }, + { + "epoch": 9.303860523038605, + "eval_entropy": 0.23534389351343, + "eval_loss": 0.932999312877655, + "eval_mean_token_accuracy": 0.8523333925147389, + "eval_num_tokens": 8731721.0, + "eval_runtime": 85.953, + "eval_samples_per_second": 15.997, + "eval_steps_per_second": 2.001, + "step": 3740 + }, + { + "entropy": 0.12327516414225101, + "epoch": 9.353673723536737, + "grad_norm": 0.16341575980186462, + "learning_rate": 2.8931377701619306e-06, + "loss": 0.05869622826576233, + "mean_token_accuracy": 0.9784224212169648, + "num_tokens": 8778614.0, + "step": 3760 + }, + { + "epoch": 9.353673723536737, + "eval_entropy": 0.23493653622477553, + "eval_loss": 0.9358566999435425, + "eval_mean_token_accuracy": 0.8522722783476807, + "eval_num_tokens": 8778614.0, + "eval_runtime": 85.2538, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.018, + "step": 3760 + }, + { + "entropy": 0.1134357453789562, + "epoch": 9.403486924034869, + "grad_norm": 0.23999616503715515, + "learning_rate": 2.4682910630645723e-06, + "loss": 0.057540220022201535, + "mean_token_accuracy": 0.9798057802021504, + "num_tokens": 8826551.0, + "step": 3780 + }, + { + "epoch": 9.403486924034869, + "eval_entropy": 0.23470525634150172, + "eval_loss": 0.937556266784668, + "eval_mean_token_accuracy": 0.8523351706044618, + "eval_num_tokens": 8826551.0, + "eval_runtime": 85.7764, + "eval_samples_per_second": 16.03, + "eval_steps_per_second": 2.005, + "step": 3780 + }, + { + "entropy": 0.1075570048764348, + "epoch": 9.453300124533001, + "grad_norm": 0.15417765080928802, + "learning_rate": 2.0768213520055406e-06, + "loss": 0.05581026673316956, + "mean_token_accuracy": 0.9797527104616165, + "num_tokens": 8876556.0, + "step": 3800 + }, + { + "epoch": 9.453300124533001, + "eval_entropy": 0.2347462713545145, + "eval_loss": 0.9383137226104736, + "eval_mean_token_accuracy": 0.8522575324357942, + "eval_num_tokens": 8876556.0, + "eval_runtime": 85.8985, + "eval_samples_per_second": 16.007, + "eval_steps_per_second": 2.002, + "step": 3800 + }, + { + "entropy": 0.12609313456341625, + "epoch": 9.503113325031133, + "grad_norm": 0.22041426599025726, + "learning_rate": 1.7188466989102739e-06, + "loss": 0.06379218697547913, + "mean_token_accuracy": 0.9763593293726445, + "num_tokens": 8920286.0, + "step": 3820 + }, + { + "epoch": 9.503113325031133, + "eval_entropy": 0.23459658849724505, + "eval_loss": 0.9393337965011597, + "eval_mean_token_accuracy": 0.8523633532052817, + "eval_num_tokens": 8920286.0, + "eval_runtime": 85.9348, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.002, + "step": 3820 + }, + { + "entropy": 0.12149709439836442, + "epoch": 9.552926525529266, + "grad_norm": 0.16608643531799316, + "learning_rate": 1.3944750640516357e-06, + "loss": 0.06341606974601746, + "mean_token_accuracy": 0.9771503552794456, + "num_tokens": 8964464.0, + "step": 3840 + }, + { + "epoch": 9.552926525529266, + "eval_entropy": 0.2347291322468325, + "eval_loss": 0.9399036765098572, + "eval_mean_token_accuracy": 0.8523768914300341, + "eval_num_tokens": 8964464.0, + "eval_runtime": 86.1305, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.997, + "step": 3840 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.785028076512891e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3860/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3860/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3860/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3860/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3860/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3860/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3860/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3860/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3860/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3860/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3860/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3860/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3860/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3860/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..9efd58cef05d1dc74ffd362e2962acc81376577f --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3860/trainer_state.json @@ -0,0 +1,4087 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 9.602739726027398, + "eval_steps": 20, + "global_step": 3860, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + }, + { + "entropy": 0.561330484598875, + "epoch": 1.891656288916563, + "grad_norm": 0.6722865700721741, + "learning_rate": 0.0002208867897174789, + "loss": 0.499837589263916, + "mean_token_accuracy": 0.8518734864890576, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.5865232653396074, + "eval_loss": 0.5437926650047302, + "eval_mean_token_accuracy": 0.8450997017843779, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4116, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.547389242425561, + "epoch": 1.9414694894146949, + "grad_norm": 0.7935577034950256, + "learning_rate": 0.00022027119820226907, + "loss": 0.4977591514587402, + "mean_token_accuracy": 0.8539491161704064, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.5290903090391048, + "eval_loss": 0.5409526824951172, + "eval_mean_token_accuracy": 0.8497545698354411, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.7262, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 780 + }, + { + "entropy": 0.5687909748405218, + "epoch": 1.9912826899128269, + "grad_norm": 0.6180546283721924, + "learning_rate": 0.00021962329729698345, + "loss": 0.5109643459320068, + "mean_token_accuracy": 0.8521598495543004, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.5503541858390321, + "eval_loss": 0.5361555218696594, + "eval_mean_token_accuracy": 0.8510884285666221, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.3339, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 800 + }, + { + "entropy": 0.4739728841261986, + "epoch": 2.0398505603985058, + "grad_norm": 0.8058829307556152, + "learning_rate": 0.0002189432823996982, + "loss": 0.4204097747802734, + "mean_token_accuracy": 0.8728981889211215, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.5077334992414297, + "eval_loss": 0.5531114339828491, + "eval_mean_token_accuracy": 0.8489257208136625, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.4801, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.989, + "step": 820 + }, + { + "entropy": 0.4594309840351343, + "epoch": 2.0896637608966375, + "grad_norm": 0.6906896829605103, + "learning_rate": 0.0002182313585936314, + "loss": 0.4071959495544434, + "mean_token_accuracy": 0.8732857562601566, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.49850136994622474, + "eval_loss": 0.5486204624176025, + "eval_mean_token_accuracy": 0.8507991450470548, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.3364, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.4881629109382629, + "epoch": 2.1394769613947697, + "grad_norm": 0.6343470215797424, + "learning_rate": 0.0002174877405852928, + "loss": 0.41669540405273436, + "mean_token_accuracy": 0.8711295068264008, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.49155513924914734, + "eval_loss": 0.555109441280365, + "eval_mean_token_accuracy": 0.8496399400539176, + "eval_num_tokens": 2008562.0, + "eval_runtime": 86.3295, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 860 + }, + { + "entropy": 0.4648668970912695, + "epoch": 2.1892901618929015, + "grad_norm": 0.8014165163040161, + "learning_rate": 0.00021671265263973133, + "loss": 0.4110250473022461, + "mean_token_accuracy": 0.8754166305065155, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.4909258722219356, + "eval_loss": 0.5539511442184448, + "eval_mean_token_accuracy": 0.8492401502160138, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.3468, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 880 + }, + { + "entropy": 0.4824485514312983, + "epoch": 2.2391033623910337, + "grad_norm": 0.6665191054344177, + "learning_rate": 0.00021590632851289967, + "loss": 0.4181404113769531, + "mean_token_accuracy": 0.8726993151009083, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.4986876940657926, + "eval_loss": 0.547695517539978, + "eval_mean_token_accuracy": 0.8501384708770486, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.3838, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 900 + }, + { + "entropy": 0.4751896943897009, + "epoch": 2.2889165628891655, + "grad_norm": 0.81158047914505, + "learning_rate": 0.00021506901138115678, + "loss": 0.40689678192138673, + "mean_token_accuracy": 0.8745221219956875, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.507153491121392, + "eval_loss": 0.5501641631126404, + "eval_mean_token_accuracy": 0.8495670116918032, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.0912, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 920 + }, + { + "entropy": 0.4873133715242147, + "epoch": 2.3387297633872977, + "grad_norm": 0.7218056321144104, + "learning_rate": 0.0002142009537679292, + "loss": 0.42701358795166017, + "mean_token_accuracy": 0.8695114746689796, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5202612736543943, + "eval_loss": 0.5491839051246643, + "eval_mean_token_accuracy": 0.8494071208460386, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.1142, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 940 + }, + { + "entropy": 0.4762951169162989, + "epoch": 2.3885429638854294, + "grad_norm": 0.7194424867630005, + "learning_rate": 0.0002133024174675534, + "loss": 0.42299847602844237, + "mean_token_accuracy": 0.8709790132939815, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4899340462546016, + "eval_loss": 0.5522511601448059, + "eval_mean_token_accuracy": 0.8492208258357159, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.463, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 960 + }, + { + "entropy": 0.49650347977876663, + "epoch": 2.4383561643835616, + "grad_norm": 0.8406022787094116, + "learning_rate": 0.0002123736734663221, + "loss": 0.4275330066680908, + "mean_token_accuracy": 0.8670595556497573, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.49691385654515996, + "eval_loss": 0.5491269826889038, + "eval_mean_token_accuracy": 0.850309816210769, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.17, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 980 + }, + { + "entropy": 0.48843890577554705, + "epoch": 2.488169364881694, + "grad_norm": 0.9082473516464233, + "learning_rate": 0.00021141500186075868, + "loss": 0.4309722423553467, + "mean_token_accuracy": 0.8686766296625137, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5543508351195691, + "eval_loss": 0.5478800535202026, + "eval_mean_token_accuracy": 0.8478029522784921, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.3835, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 1000 + }, + { + "entropy": 0.4777219031006098, + "epoch": 2.5379825653798256, + "grad_norm": 0.7448089122772217, + "learning_rate": 0.0002104266917731438, + "loss": 0.423325252532959, + "mean_token_accuracy": 0.8706337086856365, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.49857561550168106, + "eval_loss": 0.5511948466300964, + "eval_mean_token_accuracy": 0.8502220289651737, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.5399, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.988, + "step": 1020 + }, + { + "entropy": 0.4844174191355705, + "epoch": 2.587795765877958, + "grad_norm": 0.794029176235199, + "learning_rate": 0.00020940904126432, + "loss": 0.4176753044128418, + "mean_token_accuracy": 0.873535567522049, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.485467542222766, + "eval_loss": 0.5539286732673645, + "eval_mean_token_accuracy": 0.8495475081510322, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.135, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 1.997, + "step": 1040 + }, + { + "entropy": 0.49070929251611234, + "epoch": 2.6376089663760895, + "grad_norm": 0.7558256983757019, + "learning_rate": 0.0002083623572438007, + "loss": 0.42867293357849123, + "mean_token_accuracy": 0.8696666076779366, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.490822730889154, + "eval_loss": 0.5434785485267639, + "eval_mean_token_accuracy": 0.850568296950917, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.4933, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 1060 + }, + { + "entropy": 0.47806114703416824, + "epoch": 2.6874221668742218, + "grad_norm": 0.6608979105949402, + "learning_rate": 0.00020728695537721047, + "loss": 0.4289727687835693, + "mean_token_accuracy": 0.8693130135536193, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.5285773256490397, + "eval_loss": 0.5444230437278748, + "eval_mean_token_accuracy": 0.8498796481032704, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.7091, + "eval_samples_per_second": 15.858, + "eval_steps_per_second": 1.984, + "step": 1080 + }, + { + "entropy": 0.5046216730028391, + "epoch": 2.7372353673723535, + "grad_norm": 0.8428544998168945, + "learning_rate": 0.00020618315999108454, + "loss": 0.43131070137023925, + "mean_token_accuracy": 0.8701941035687923, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.49888394738352576, + "eval_loss": 0.5459766387939453, + "eval_mean_token_accuracy": 0.8511758872935938, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.2222, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.995, + "step": 1100 + }, + { + "entropy": 0.5212558470666409, + "epoch": 2.7870485678704857, + "grad_norm": 1.129318118095398, + "learning_rate": 0.00020505130397505635, + "loss": 0.44249300956726073, + "mean_token_accuracy": 0.8654101334512234, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5179622324053631, + "eval_loss": 0.5522801280021667, + "eval_mean_token_accuracy": 0.8497019947268242, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.1903, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.996, + "step": 1120 + }, + { + "entropy": 0.4988406613469124, + "epoch": 2.8368617683686175, + "grad_norm": 0.6460545063018799, + "learning_rate": 0.00020389172868146263, + "loss": 0.4386270523071289, + "mean_token_accuracy": 0.8690383620560169, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.5042278484203094, + "eval_loss": 0.5433034300804138, + "eval_mean_token_accuracy": 0.8497674451317898, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.3028, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.993, + "step": 1140 + }, + { + "entropy": 0.4926559619605541, + "epoch": 2.8866749688667497, + "grad_norm": 0.8199329972267151, + "learning_rate": 0.00020270478382239615, + "loss": 0.4313485145568848, + "mean_token_accuracy": 0.8674727231264114, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.503873193160046, + "eval_loss": 0.5388111472129822, + "eval_mean_token_accuracy": 0.8526195034731266, + "eval_num_tokens": 2710196.0, + "eval_runtime": 86.4054, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.991, + "step": 1160 + }, + { + "entropy": 0.5020013231784105, + "epoch": 2.936488169364882, + "grad_norm": 0.7344821095466614, + "learning_rate": 0.00020149082736423723, + "loss": 0.43590536117553713, + "mean_token_accuracy": 0.8671772189438343, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5368241809828337, + "eval_loss": 0.5355703830718994, + "eval_mean_token_accuracy": 0.8517617773871089, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.2945, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1180 + }, + { + "entropy": 0.5112275708466768, + "epoch": 2.9863013698630136, + "grad_norm": 0.6951606869697571, + "learning_rate": 0.00020025022541969622, + "loss": 0.43579301834106443, + "mean_token_accuracy": 0.8641206480562686, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.5066795706055885, + "eval_loss": 0.5415249466896057, + "eval_mean_token_accuracy": 0.8493563373421513, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.5005, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.988, + "step": 1200 + }, + { + "entropy": 0.42298635305502474, + "epoch": 3.0348692403486925, + "grad_norm": 0.8201794028282166, + "learning_rate": 0.00019898335213739863, + "loss": 0.35593905448913576, + "mean_token_accuracy": 0.889238600547497, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.4584170470750609, + "eval_loss": 0.569487452507019, + "eval_mean_token_accuracy": 0.8495814173027526, + "eval_num_tokens": 2848509.0, + "eval_runtime": 86.2281, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 1220 + }, + { + "entropy": 0.37450140453875064, + "epoch": 3.0846824408468243, + "grad_norm": 0.7308394908905029, + "learning_rate": 0.0001976905895890471, + "loss": 0.307823920249939, + "mean_token_accuracy": 0.9001288741827012, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.45185995916294497, + "eval_loss": 0.5672881603240967, + "eval_mean_token_accuracy": 0.8511318519364955, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.0819, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.998, + "step": 1240 + }, + { + "entropy": 0.3887945845723152, + "epoch": 3.1344956413449565, + "grad_norm": 0.7299330830574036, + "learning_rate": 0.0001963723276541939, + "loss": 0.32047903537750244, + "mean_token_accuracy": 0.8960984498262405, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.44865354549053105, + "eval_loss": 0.5666037201881409, + "eval_mean_token_accuracy": 0.8496572649063066, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 1260 + }, + { + "entropy": 0.39677664265036583, + "epoch": 3.1843088418430883, + "grad_norm": 0.9533219933509827, + "learning_rate": 0.00019502896390265838, + "loss": 0.3253983497619629, + "mean_token_accuracy": 0.8964207418262958, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.4641980809527774, + "eval_loss": 0.5814996957778931, + "eval_mean_token_accuracy": 0.8485886212005171, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.7784, + "eval_samples_per_second": 15.845, + "eval_steps_per_second": 1.982, + "step": 1280 + }, + { + "entropy": 0.39210722744464876, + "epoch": 3.2341220423412205, + "grad_norm": 0.7447651028633118, + "learning_rate": 0.00019366090347462545, + "loss": 0.3276803970336914, + "mean_token_accuracy": 0.8930055953562259, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43595615254585135, + "eval_loss": 0.5722188353538513, + "eval_mean_token_accuracy": 0.8501105755567551, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.5271, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 1300 + }, + { + "entropy": 0.3684127271175385, + "epoch": 3.2839352428393527, + "grad_norm": 0.6934201121330261, + "learning_rate": 0.00019226855895846078, + "loss": 0.3156379222869873, + "mean_token_accuracy": 0.8976306475698947, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.4628148723480313, + "eval_loss": 0.5631352066993713, + "eval_mean_token_accuracy": 0.8504934813394103, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.3436, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 1320 + }, + { + "entropy": 0.4073401909321547, + "epoch": 3.3337484433374844, + "grad_norm": 0.9386897683143616, + "learning_rate": 0.00019085235026627994, + "loss": 0.34265310764312745, + "mean_token_accuracy": 0.8902062118053437, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.46455050623694133, + "eval_loss": 0.5586736798286438, + "eval_mean_token_accuracy": 0.8506874702004499, + "eval_num_tokens": 3132874.0, + "eval_runtime": 86.1286, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.997, + "step": 1340 + }, + { + "entropy": 0.4046429242938757, + "epoch": 3.383561643835616, + "grad_norm": 0.9633992314338684, + "learning_rate": 0.00018941270450730836, + "loss": 0.33816893100738527, + "mean_token_accuracy": 0.8927541889250279, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.46846531660750856, + "eval_loss": 0.561501681804657, + "eval_mean_token_accuracy": 0.8496256377114806, + "eval_num_tokens": 3178055.0, + "eval_runtime": 86.685, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1360 + }, + { + "entropy": 0.39872407019138334, + "epoch": 3.4333748443337484, + "grad_norm": 0.7786458730697632, + "learning_rate": 0.00018795005585907113, + "loss": 0.33342490196228025, + "mean_token_accuracy": 0.8944805048406124, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.42709505973860273, + "eval_loss": 0.5751848220825195, + "eval_mean_token_accuracy": 0.8507290447867194, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.6892, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 1380 + }, + { + "entropy": 0.3923338124528527, + "epoch": 3.4831880448318806, + "grad_norm": 0.9305956363677979, + "learning_rate": 0.0001864648454364511, + "loss": 0.33188116550445557, + "mean_token_accuracy": 0.8943330392241478, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.4386174779298694, + "eval_loss": 0.5680831074714661, + "eval_mean_token_accuracy": 0.8513129727784977, + "eval_num_tokens": 3274096.0, + "eval_runtime": 86.2671, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 1400 + }, + { + "entropy": 0.3856233984231949, + "epoch": 3.5330012453300124, + "grad_norm": 1.0362752676010132, + "learning_rate": 0.0001849575211586545, + "loss": 0.33098697662353516, + "mean_token_accuracy": 0.8961390435695649, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4574795474493226, + "eval_loss": 0.5630439519882202, + "eval_mean_token_accuracy": 0.8520988873964133, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.6035, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 1420 + }, + { + "entropy": 0.39812871962785723, + "epoch": 3.5828144458281446, + "grad_norm": 0.7807195782661438, + "learning_rate": 0.0001834285376141247, + "loss": 0.3333771228790283, + "mean_token_accuracy": 0.8930827379226685, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.4556825893909432, + "eval_loss": 0.5689062476158142, + "eval_mean_token_accuracy": 0.8507103507601937, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.1606, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.996, + "step": 1440 + }, + { + "entropy": 0.4147744856774807, + "epoch": 3.6326276463262763, + "grad_norm": 0.6429352164268494, + "learning_rate": 0.00018187835592344443, + "loss": 0.3482560873031616, + "mean_token_accuracy": 0.8910200245678425, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.46600024540757023, + "eval_loss": 0.5609709024429321, + "eval_mean_token_accuracy": 0.8491220876227977, + "eval_num_tokens": 3415600.0, + "eval_runtime": 86.8039, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1460 + }, + { + "entropy": 0.40425071083009245, + "epoch": 3.6824408468244085, + "grad_norm": 0.8613698482513428, + "learning_rate": 0.0001803074436002682, + "loss": 0.342916464805603, + "mean_token_accuracy": 0.8916418336331844, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.43855057899342026, + "eval_loss": 0.5720968246459961, + "eval_mean_token_accuracy": 0.8500823641932288, + "eval_num_tokens": 3460471.0, + "eval_runtime": 86.6746, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1480 + }, + { + "entropy": 0.39465143866837027, + "epoch": 3.7322540473225407, + "grad_norm": 0.6285189986228943, + "learning_rate": 0.0001787162744103265, + "loss": 0.3424591779708862, + "mean_token_accuracy": 0.8906558901071548, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4509461877304454, + "eval_loss": 0.5590082406997681, + "eval_mean_token_accuracy": 0.8511747371318729, + "eval_num_tokens": 3507647.0, + "eval_runtime": 86.8126, + "eval_samples_per_second": 15.839, + "eval_steps_per_second": 1.981, + "step": 1500 + }, + { + "entropy": 0.4021005939692259, + "epoch": 3.7820672478206725, + "grad_norm": 0.8821248412132263, + "learning_rate": 0.00017710532822854468, + "loss": 0.3462103843688965, + "mean_token_accuracy": 0.889109355956316, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.4502199075596277, + "eval_loss": 0.566046416759491, + "eval_mean_token_accuracy": 0.8501714208098345, + "eval_num_tokens": 3548934.0, + "eval_runtime": 86.8336, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.981, + "step": 1520 + }, + { + "entropy": 0.4017397932708263, + "epoch": 3.8318804483188043, + "grad_norm": 0.8400952816009521, + "learning_rate": 0.0001754750908943189, + "loss": 0.34890995025634763, + "mean_token_accuracy": 0.8892098367214203, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.4614003023435903, + "eval_loss": 0.5617933869361877, + "eval_mean_token_accuracy": 0.8515863616106122, + "eval_num_tokens": 3597186.0, + "eval_runtime": 86.4609, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 1540 + }, + { + "entropy": 0.4112051840871572, + "epoch": 3.8816936488169365, + "grad_norm": 0.769478440284729, + "learning_rate": 0.0001738260540649939, + "loss": 0.34711437225341796, + "mean_token_accuracy": 0.8911717928946018, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4540443811998811, + "eval_loss": 0.5576469898223877, + "eval_mean_token_accuracy": 0.8512079674144124, + "eval_num_tokens": 3646646.0, + "eval_runtime": 86.5103, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 1560 + }, + { + "entropy": 0.41105241514742374, + "epoch": 3.9315068493150687, + "grad_norm": 0.8468427062034607, + "learning_rate": 0.00017215871506758568, + "loss": 0.3433023452758789, + "mean_token_accuracy": 0.8898739732801915, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.4707539707075718, + "eval_loss": 0.5641466379165649, + "eval_mean_token_accuracy": 0.8495440957851188, + "eval_num_tokens": 3689560.0, + "eval_runtime": 86.609, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.986, + "step": 1580 + }, + { + "entropy": 0.41016379147768023, + "epoch": 3.9813200498132004, + "grad_norm": 0.7482675313949585, + "learning_rate": 0.0001704735767487946, + "loss": 0.34550890922546384, + "mean_token_accuracy": 0.8893028847873211, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.46391099864660307, + "eval_loss": 0.5593640804290771, + "eval_mean_token_accuracy": 0.8510130581467651, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.3975, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 1600 + }, + { + "entropy": 0.33167599791135544, + "epoch": 4.029887920298879, + "grad_norm": 0.9435692429542542, + "learning_rate": 0.00016877114732335337, + "loss": 0.2716026544570923, + "mean_token_accuracy": 0.9133149828666296, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.38499350005457567, + "eval_loss": 0.6298249363899231, + "eval_mean_token_accuracy": 0.8488117071778275, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.2933, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1620 + }, + { + "entropy": 0.3000166634097695, + "epoch": 4.0797011207970115, + "grad_norm": 0.8080845475196838, + "learning_rate": 0.0001670519402207569, + "loss": 0.22617182731628419, + "mean_token_accuracy": 0.9253474645316601, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.370110988703578, + "eval_loss": 0.6338461637496948, + "eval_mean_token_accuracy": 0.8485634801692741, + "eval_num_tokens": 3828830.0, + "eval_runtime": 85.9508, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.001, + "step": 1640 + }, + { + "entropy": 0.2986910421401262, + "epoch": 4.129514321295143, + "grad_norm": 0.7310900092124939, + "learning_rate": 0.0001653164739304185, + "loss": 0.22367463111877442, + "mean_token_accuracy": 0.9252275295555592, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.3944379702037157, + "eval_loss": 0.6109381914138794, + "eval_mean_token_accuracy": 0.849291454220927, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.6728, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1660 + }, + { + "entropy": 0.3095553796738386, + "epoch": 4.179327521793275, + "grad_norm": 0.7059140801429749, + "learning_rate": 0.0001635652718453007, + "loss": 0.23651680946350098, + "mean_token_accuracy": 0.9208931416273117, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.3910588648949945, + "eval_loss": 0.6104469299316406, + "eval_mean_token_accuracy": 0.8486883893262508, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7612, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.982, + "step": 1680 + }, + { + "entropy": 0.3001101028174162, + "epoch": 4.229140722291407, + "grad_norm": 0.6787802577018738, + "learning_rate": 0.00016179886210406728, + "loss": 0.23130471706390382, + "mean_token_accuracy": 0.9233332790434361, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3794369170832079, + "eval_loss": 0.6182110905647278, + "eval_mean_token_accuracy": 0.8495433777570724, + "eval_num_tokens": 3967474.0, + "eval_runtime": 85.94, + "eval_samples_per_second": 16.0, + "eval_steps_per_second": 2.001, + "step": 1700 + }, + { + "entropy": 0.3031421799212694, + "epoch": 4.2789539227895395, + "grad_norm": 0.9732038378715515, + "learning_rate": 0.0001600177774318036, + "loss": 0.2359529733657837, + "mean_token_accuracy": 0.9217648565769195, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3923123094231583, + "eval_loss": 0.6057384610176086, + "eval_mean_token_accuracy": 0.8508818288182103, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7647, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.29365369994193313, + "epoch": 4.328767123287671, + "grad_norm": 0.7681498527526855, + "learning_rate": 0.0001582225549793541, + "loss": 0.2269371747970581, + "mean_token_accuracy": 0.9245341829955578, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.4011661055129628, + "eval_loss": 0.6144486665725708, + "eval_mean_token_accuracy": 0.8480324357054955, + "eval_num_tokens": 4062594.0, + "eval_runtime": 87.1306, + "eval_samples_per_second": 15.781, + "eval_steps_per_second": 1.974, + "step": 1740 + }, + { + "entropy": 0.29396994728595016, + "epoch": 4.378580323785803, + "grad_norm": 1.0001007318496704, + "learning_rate": 0.0001564137361613248, + "loss": 0.22777395248413085, + "mean_token_accuracy": 0.9262309700250626, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38518730195802314, + "eval_loss": 0.6202630400657654, + "eval_mean_token_accuracy": 0.8493869807137999, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6616, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.3096018506214023, + "epoch": 4.428393524283935, + "grad_norm": 1.0448365211486816, + "learning_rate": 0.00015459186649280024, + "loss": 0.23696351051330566, + "mean_token_accuracy": 0.9217322513461113, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.3946371126140273, + "eval_loss": 0.6079026460647583, + "eval_mean_token_accuracy": 0.8492515852978063, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6582, + "eval_samples_per_second": 15.867, + "eval_steps_per_second": 1.985, + "step": 1780 + }, + { + "entropy": 0.32619857545942066, + "epoch": 4.478206724782067, + "grad_norm": 0.7210651636123657, + "learning_rate": 0.00015275749542482337, + "loss": 0.24651215076446534, + "mean_token_accuracy": 0.9177676141262054, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.3947690814560236, + "eval_loss": 0.6065912246704102, + "eval_mean_token_accuracy": 0.8502957744653835, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.5959, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.986, + "step": 1800 + }, + { + "entropy": 0.3193941755220294, + "epoch": 4.5280199252802, + "grad_norm": 0.8281906843185425, + "learning_rate": 0.0001509111761786888, + "loss": 0.23936262130737304, + "mean_token_accuracy": 0.9201708927750587, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38704028864239537, + "eval_loss": 0.6006569266319275, + "eval_mean_token_accuracy": 0.8502406720505205, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.8059, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1820 + }, + { + "entropy": 0.3164879363030195, + "epoch": 4.577833125778331, + "grad_norm": 0.7892968654632568, + "learning_rate": 0.00014905346557909867, + "loss": 0.24541733264923096, + "mean_token_accuracy": 0.9175932116806507, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.38861122120951497, + "eval_loss": 0.6115967631340027, + "eval_mean_token_accuracy": 0.849471275196519, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.2946, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1840 + }, + { + "entropy": 0.3051785985007882, + "epoch": 4.627646326276463, + "grad_norm": 0.8109654188156128, + "learning_rate": 0.0001471849238862319, + "loss": 0.23433220386505127, + "mean_token_accuracy": 0.9206570319831371, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.37162452295076015, + "eval_loss": 0.6184061765670776, + "eval_mean_token_accuracy": 0.8501173268223918, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.6865, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1860 + }, + { + "entropy": 0.3168198253959417, + "epoch": 4.677459526774595, + "grad_norm": 0.9512342214584351, + "learning_rate": 0.0001453061146267775, + "loss": 0.23832404613494873, + "mean_token_accuracy": 0.9197044663131237, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3845940856912801, + "eval_loss": 0.606762707233429, + "eval_mean_token_accuracy": 0.8504838194957999, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.5175, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 1880 + }, + { + "entropy": 0.30791807882487776, + "epoch": 4.7272727272727275, + "grad_norm": 0.8123113512992859, + "learning_rate": 0.00014341760442398248, + "loss": 0.2395785331726074, + "mean_token_accuracy": 0.918928150832653, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.39762327222283494, + "eval_loss": 0.5994202494621277, + "eval_mean_token_accuracy": 0.8509274201337681, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.2873, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.993, + "step": 1900 + }, + { + "entropy": 0.3021434534341097, + "epoch": 4.777085927770859, + "grad_norm": 0.731787383556366, + "learning_rate": 0.000141519962826766, + "loss": 0.23494718074798585, + "mean_token_accuracy": 0.9201403826475143, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.3827026732439219, + "eval_loss": 0.5995895862579346, + "eval_mean_token_accuracy": 0.851468373523202, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.3006, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 1920 + }, + { + "entropy": 0.31626159623265265, + "epoch": 4.826899128268991, + "grad_norm": 0.8848487138748169, + "learning_rate": 0.00013961376213795132, + "loss": 0.2439030647277832, + "mean_token_accuracy": 0.9196575872600079, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.388698436839636, + "eval_loss": 0.6000174283981323, + "eval_mean_token_accuracy": 0.8518068187458571, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.8979, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.979, + "step": 1940 + }, + { + "entropy": 0.30520407035946845, + "epoch": 4.876712328767123, + "grad_norm": 0.8532460927963257, + "learning_rate": 0.00013769957724166695, + "loss": 0.23458616733551024, + "mean_token_accuracy": 0.9221912942826748, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.38777847102908203, + "eval_loss": 0.6004981398582458, + "eval_mean_token_accuracy": 0.8516481768253238, + "eval_num_tokens": 4578167.0, + "eval_runtime": 87.0777, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.975, + "step": 1960 + }, + { + "entropy": 0.3226448342204094, + "epoch": 4.926525529265255, + "grad_norm": 0.6945561766624451, + "learning_rate": 0.0001357779854299694, + "loss": 0.24048397541046143, + "mean_token_accuracy": 0.9195300146937371, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.38581624263247777, + "eval_loss": 0.6029234528541565, + "eval_mean_token_accuracy": 0.8514213260523108, + "eval_num_tokens": 4622316.0, + "eval_runtime": 85.8729, + "eval_samples_per_second": 16.012, + "eval_steps_per_second": 2.003, + "step": 1980 + }, + { + "entropy": 0.3051655298098922, + "epoch": 4.976338729763388, + "grad_norm": 0.7976452708244324, + "learning_rate": 0.00013384956622874001, + "loss": 0.23584742546081544, + "mean_token_accuracy": 0.9216851457953453, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.37913159246361533, + "eval_loss": 0.6057604551315308, + "eval_mean_token_accuracy": 0.8525801203971686, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.1145, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 2000 + }, + { + "entropy": 0.27438195240803254, + "epoch": 5.024906600249066, + "grad_norm": 0.6729586124420166, + "learning_rate": 0.0001319149012229075, + "loss": 0.19775952100753785, + "mean_token_accuracy": 0.9339428559327737, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.3448961910813354, + "eval_loss": 0.6750120520591736, + "eval_mean_token_accuracy": 0.8487970232963562, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.1169, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 2020 + }, + { + "entropy": 0.21423916313797237, + "epoch": 5.074719800747198, + "grad_norm": 0.6934391856193542, + "learning_rate": 0.00012997457388105022, + "loss": 0.1439570426940918, + "mean_token_accuracy": 0.9528236843645572, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.3570949243771475, + "eval_loss": 0.6465504169464111, + "eval_mean_token_accuracy": 0.8490785547467166, + "eval_num_tokens": 4763269.0, + "eval_runtime": 85.9574, + "eval_samples_per_second": 15.996, + "eval_steps_per_second": 2.001, + "step": 2040 + }, + { + "entropy": 0.20838565267622472, + "epoch": 5.12453300124533, + "grad_norm": 0.7286986112594604, + "learning_rate": 0.00012802916937942972, + "loss": 0.14467307329177856, + "mean_token_accuracy": 0.950994835793972, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.3452463157821533, + "eval_loss": 0.6705958843231201, + "eval_mean_token_accuracy": 0.8490352796953778, + "eval_num_tokens": 4809047.0, + "eval_runtime": 86.228, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 2060 + }, + { + "entropy": 0.20453082229942082, + "epoch": 5.174346201743462, + "grad_norm": 0.7515555620193481, + "learning_rate": 0.00012607927442550974, + "loss": 0.13732000589370727, + "mean_token_accuracy": 0.9537357829511166, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.32431264914745506, + "eval_loss": 0.6743043065071106, + "eval_mean_token_accuracy": 0.8504878629085629, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.5948, + "eval_samples_per_second": 15.879, + "eval_steps_per_second": 1.986, + "step": 2080 + }, + { + "entropy": 0.21812320686876774, + "epoch": 5.224159402241594, + "grad_norm": 0.9093465209007263, + "learning_rate": 0.0001241254770810132, + "loss": 0.14311420917510986, + "mean_token_accuracy": 0.9514068141579628, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.33086285835435225, + "eval_loss": 0.6676449179649353, + "eval_mean_token_accuracy": 0.8505287662495015, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 2100 + }, + { + "entropy": 0.2180163251236081, + "epoch": 5.273972602739726, + "grad_norm": 0.6703007221221924, + "learning_rate": 0.00012216836658457075, + "loss": 0.14803968667984008, + "mean_token_accuracy": 0.9521303348243236, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.33162341708707255, + "eval_loss": 0.6658875942230225, + "eval_mean_token_accuracy": 0.8500757605530495, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.6296, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 2120 + }, + { + "entropy": 0.22511130161583423, + "epoch": 5.323785803237858, + "grad_norm": 0.8078880906105042, + "learning_rate": 0.00012020853317401455, + "loss": 0.15228408575057983, + "mean_token_accuracy": 0.947144789993763, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3354601170434508, + "eval_loss": 0.6677829623222351, + "eval_mean_token_accuracy": 0.8482600024273229, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.4689, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.989, + "step": 2140 + }, + { + "entropy": 0.2244176059961319, + "epoch": 5.37359900373599, + "grad_norm": 0.9636075496673584, + "learning_rate": 0.00011824656790837037, + "loss": 0.15260883569717407, + "mean_token_accuracy": 0.9471467643976211, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.3381616926297199, + "eval_loss": 0.6694412231445312, + "eval_mean_token_accuracy": 0.8482369603805764, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.4147, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 2160 + }, + { + "entropy": 0.22982364390045404, + "epoch": 5.423412204234122, + "grad_norm": 0.775401771068573, + "learning_rate": 0.00011628306248960262, + "loss": 0.15140302181243898, + "mean_token_accuracy": 0.9492553934454918, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.3305150235808173, + "eval_loss": 0.6717822551727295, + "eval_mean_token_accuracy": 0.8489849723355715, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.4728, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.989, + "step": 2180 + }, + { + "entropy": 0.21448935717344284, + "epoch": 5.473225404732254, + "grad_norm": 0.6575281023979187, + "learning_rate": 0.00011431860908416465, + "loss": 0.1452319622039795, + "mean_token_accuracy": 0.9505287684500218, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3488145174328671, + "eval_loss": 0.6612305641174316, + "eval_mean_token_accuracy": 0.8492907808963642, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6927, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 2200 + }, + { + "entropy": 0.23091202937066554, + "epoch": 5.523038605230386, + "grad_norm": 0.8909686207771301, + "learning_rate": 0.00011235380014440985, + "loss": 0.15150139331817628, + "mean_token_accuracy": 0.9497875183820724, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.3268539015810157, + "eval_loss": 0.6667542457580566, + "eval_mean_token_accuracy": 0.8499062903398691, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.4644, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 2220 + }, + { + "entropy": 0.2227974807843566, + "epoch": 5.572851805728518, + "grad_norm": 0.6180275082588196, + "learning_rate": 0.0001103892282299158, + "loss": 0.1491069197654724, + "mean_token_accuracy": 0.9488144010305405, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3346347655494546, + "eval_loss": 0.6665948629379272, + "eval_mean_token_accuracy": 0.8499961893918903, + "eval_num_tokens": 5226864.0, + "eval_runtime": 87.0548, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.976, + "step": 2240 + }, + { + "entropy": 0.21368421968072654, + "epoch": 5.62266500622665, + "grad_norm": 0.6004369258880615, + "learning_rate": 0.00010842548582877651, + "loss": 0.14485255479812623, + "mean_token_accuracy": 0.9502056457102299, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.32753298804163933, + "eval_loss": 0.6680151224136353, + "eval_mean_token_accuracy": 0.8515451086121936, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.8524, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.98, + "step": 2260 + }, + { + "entropy": 0.2103635374456644, + "epoch": 5.672478206724782, + "grad_norm": 0.699174702167511, + "learning_rate": 0.00010646316517891613, + "loss": 0.14297772645950318, + "mean_token_accuracy": 0.9512537539005279, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.32966585959806, + "eval_loss": 0.675578773021698, + "eval_mean_token_accuracy": 0.8509623023659684, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.4518, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.99, + "step": 2280 + }, + { + "entropy": 0.22516900151968003, + "epoch": 5.722291407222914, + "grad_norm": 0.6637354493141174, + "learning_rate": 0.00010450285808947797, + "loss": 0.15202572345733642, + "mean_token_accuracy": 0.9482452072203159, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3369456917740578, + "eval_loss": 0.6697061061859131, + "eval_mean_token_accuracy": 0.848603522361711, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.6371, + "eval_samples_per_second": 15.871, + "eval_steps_per_second": 1.985, + "step": 2300 + }, + { + "entropy": 0.21841065725311637, + "epoch": 5.772104607721046, + "grad_norm": 0.7940268516540527, + "learning_rate": 0.00010254515576234297, + "loss": 0.14710167646408082, + "mean_token_accuracy": 0.9493498183786869, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3237486180177955, + "eval_loss": 0.6779657602310181, + "eval_mean_token_accuracy": 0.8500715313955794, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.1826, + "eval_samples_per_second": 15.954, + "eval_steps_per_second": 1.996, + "step": 2320 + }, + { + "entropy": 0.22146204356104135, + "epoch": 5.821917808219178, + "grad_norm": 0.9234833121299744, + "learning_rate": 0.00010059064861383132, + "loss": 0.14720046520233154, + "mean_token_accuracy": 0.9493872679769992, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.32365207564692167, + "eval_loss": 0.6704005002975464, + "eval_mean_token_accuracy": 0.8507985760306203, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.5494, + "eval_samples_per_second": 15.887, + "eval_steps_per_second": 1.987, + "step": 2340 + }, + { + "entropy": 0.20934011954814197, + "epoch": 5.87173100871731, + "grad_norm": 0.5547503232955933, + "learning_rate": 9.863992609664084e-05, + "loss": 0.1464867353439331, + "mean_token_accuracy": 0.9503875687718392, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.3330401429083458, + "eval_loss": 0.6659091114997864, + "eval_mean_token_accuracy": 0.8504848906467127, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.5855, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 2360 + }, + { + "entropy": 0.21678635366261007, + "epoch": 5.921544209215442, + "grad_norm": 0.570612907409668, + "learning_rate": 9.669357652207635e-05, + "loss": 0.14821385145187377, + "mean_token_accuracy": 0.9503940217196941, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3322022325077722, + "eval_loss": 0.6722489595413208, + "eval_mean_token_accuracy": 0.8489979422369669, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.2986, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 2380 + }, + { + "entropy": 0.20932920072227718, + "epoch": 5.971357409713574, + "grad_norm": 0.7879557609558105, + "learning_rate": 9.475218688262262e-05, + "loss": 0.14675841331481934, + "mean_token_accuracy": 0.9507176131010056, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.3199348642902319, + "eval_loss": 0.6698136329650879, + "eval_mean_token_accuracy": 0.8514142130003419, + "eval_num_tokens": 5605400.0, + "eval_runtime": 85.8995, + "eval_samples_per_second": 16.007, + "eval_steps_per_second": 2.002, + "step": 2400 + }, + { + "entropy": 0.21032143919131693, + "epoch": 6.019925280199253, + "grad_norm": 0.5823076367378235, + "learning_rate": 9.281634267491569e-05, + "loss": 0.13322267532348633, + "mean_token_accuracy": 0.9550939072401096, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.30206270117399303, + "eval_loss": 0.7093168497085571, + "eval_mean_token_accuracy": 0.8500627639681794, + "eval_num_tokens": 5648968.0, + "eval_runtime": 85.8128, + "eval_samples_per_second": 16.023, + "eval_steps_per_second": 2.004, + "step": 2420 + }, + { + "entropy": 0.1534628233872354, + "epoch": 6.069738480697385, + "grad_norm": 0.710133969783783, + "learning_rate": 9.088662772316508e-05, + "loss": 0.09078952670097351, + "mean_token_accuracy": 0.9678447999060154, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.28208133101809857, + "eval_loss": 0.7636417150497437, + "eval_mean_token_accuracy": 0.8494061477655588, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9724, + "eval_samples_per_second": 15.994, + "eval_steps_per_second": 2.001, + "step": 2440 + }, + { + "entropy": 0.16151462448760867, + "epoch": 6.119551681195516, + "grad_norm": 0.5793812274932861, + "learning_rate": 8.896362400308028e-05, + "loss": 0.09545697569847107, + "mean_token_accuracy": 0.9671573750674725, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.2833245605403601, + "eval_loss": 0.7402405738830566, + "eval_mean_token_accuracy": 0.8503523728875226, + "eval_num_tokens": 5745090.0, + "eval_runtime": 85.5461, + "eval_samples_per_second": 16.073, + "eval_steps_per_second": 2.011, + "step": 2460 + }, + { + "entropy": 0.15203177919611335, + "epoch": 6.169364881693649, + "grad_norm": 0.4251123368740082, + "learning_rate": 8.704791146635483e-05, + "loss": 0.09420782327651978, + "mean_token_accuracy": 0.9677386932075024, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.28572545962971313, + "eval_loss": 0.735416829586029, + "eval_mean_token_accuracy": 0.8487084663884584, + "eval_num_tokens": 5790333.0, + "eval_runtime": 85.4801, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.012, + "step": 2480 + }, + { + "entropy": 0.15587336672469973, + "epoch": 6.219178082191781, + "grad_norm": 0.4357028007507324, + "learning_rate": 8.514006786576085e-05, + "loss": 0.09429320096969604, + "mean_token_accuracy": 0.9682952925562859, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.2859006894882335, + "eval_loss": 0.7347224950790405, + "eval_mean_token_accuracy": 0.8501905518215757, + "eval_num_tokens": 5837321.0, + "eval_runtime": 85.7578, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.006, + "step": 2500 + }, + { + "entropy": 0.15765639198943973, + "epoch": 6.268991282689913, + "grad_norm": 0.47331130504608154, + "learning_rate": 8.324066858090663e-05, + "loss": 0.09571113586425781, + "mean_token_accuracy": 0.9683481335639954, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.29231513846059176, + "eval_loss": 0.7392512559890747, + "eval_mean_token_accuracy": 0.8486633983462356, + "eval_num_tokens": 5884398.0, + "eval_runtime": 85.7846, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.005, + "step": 2520 + }, + { + "entropy": 0.16176860257983208, + "epoch": 6.318804483188045, + "grad_norm": 0.6142018437385559, + "learning_rate": 8.135028644470992e-05, + "loss": 0.09486144185066223, + "mean_token_accuracy": 0.9682316601276397, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.2851274753379267, + "eval_loss": 0.7520816922187805, + "eval_mean_token_accuracy": 0.8501113649717597, + "eval_num_tokens": 5929876.0, + "eval_runtime": 85.9425, + "eval_samples_per_second": 15.999, + "eval_steps_per_second": 2.001, + "step": 2540 + }, + { + "entropy": 0.15404034564271568, + "epoch": 6.3686176836861765, + "grad_norm": 0.6051287651062012, + "learning_rate": 7.946949157063964e-05, + "loss": 0.09280472993850708, + "mean_token_accuracy": 0.9684635892510414, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28802703563557114, + "eval_loss": 0.7439162135124207, + "eval_mean_token_accuracy": 0.8499851770872293, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.0703, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.998, + "step": 2560 + }, + { + "entropy": 0.15343588953837753, + "epoch": 6.418430884184309, + "grad_norm": 0.4823743402957916, + "learning_rate": 7.759885118077701e-05, + "loss": 0.09000591039657593, + "mean_token_accuracy": 0.9699928767979145, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2795634938533916, + "eval_loss": 0.7647850513458252, + "eval_mean_token_accuracy": 0.8503464397995971, + "eval_num_tokens": 6025380.0, + "eval_runtime": 85.8886, + "eval_samples_per_second": 16.009, + "eval_steps_per_second": 2.003, + "step": 2580 + }, + { + "entropy": 0.15740026142448188, + "epoch": 6.468244084682441, + "grad_norm": 0.5082696676254272, + "learning_rate": 7.57389294347494e-05, + "loss": 0.09191849827766418, + "mean_token_accuracy": 0.9692809768021107, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2913342311458532, + "eval_loss": 0.7518694996833801, + "eval_mean_token_accuracy": 0.8483168302580367, + "eval_num_tokens": 6073349.0, + "eval_runtime": 85.5761, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.01, + "step": 2600 + }, + { + "entropy": 0.15922069251537324, + "epoch": 6.518057285180573, + "grad_norm": 0.3995199501514435, + "learning_rate": 7.389028725958736e-05, + "loss": 0.09584367871284485, + "mean_token_accuracy": 0.9685114495456218, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.2863075934177221, + "eval_loss": 0.7539381384849548, + "eval_mean_token_accuracy": 0.8507507083027862, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.112, + "eval_samples_per_second": 15.968, + "eval_steps_per_second": 1.997, + "step": 2620 + }, + { + "entropy": 0.16197575423866512, + "epoch": 6.567870485678705, + "grad_norm": 0.534295380115509, + "learning_rate": 7.205348218055678e-05, + "loss": 0.0961170256137848, + "mean_token_accuracy": 0.9674530044198036, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.29021967315050057, + "eval_loss": 0.751198947429657, + "eval_mean_token_accuracy": 0.8509796344956686, + "eval_num_tokens": 6165523.0, + "eval_runtime": 85.7958, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.005, + "step": 2640 + }, + { + "entropy": 0.15261746793985367, + "epoch": 6.617683686176837, + "grad_norm": 0.5391237139701843, + "learning_rate": 7.022906815301673e-05, + "loss": 0.0926026999950409, + "mean_token_accuracy": 0.9695659473538398, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.29128045216202736, + "eval_loss": 0.7450292110443115, + "eval_mean_token_accuracy": 0.8498771443616512, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.3963, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 2660 + }, + { + "entropy": 0.16164180357009172, + "epoch": 6.667496886674969, + "grad_norm": 0.5767946243286133, + "learning_rate": 6.841759539535419e-05, + "loss": 0.09291981458663941, + "mean_token_accuracy": 0.9687136687338352, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2897637223088464, + "eval_loss": 0.7503410577774048, + "eval_mean_token_accuracy": 0.8503315164599308, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.0653, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.998, + "step": 2680 + }, + { + "entropy": 0.17062523355707526, + "epoch": 6.717310087173101, + "grad_norm": 0.4974168539047241, + "learning_rate": 6.661961022304563e-05, + "loss": 0.09713236689567566, + "mean_token_accuracy": 0.9661971725523472, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2765843396963075, + "eval_loss": 0.7604002356529236, + "eval_mean_token_accuracy": 0.8521115277395692, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.1676, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 2700 + }, + { + "entropy": 0.17544092936441302, + "epoch": 6.767123287671232, + "grad_norm": 0.5523537993431091, + "learning_rate": 6.483565488389582e-05, + "loss": 0.09709116220474243, + "mean_token_accuracy": 0.9650957375764847, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.27939334659035814, + "eval_loss": 0.7534670829772949, + "eval_mean_token_accuracy": 0.851230604010959, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.2913, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 2720 + }, + { + "entropy": 0.15991022661328316, + "epoch": 6.816936488169365, + "grad_norm": 0.478551983833313, + "learning_rate": 6.306626739450311e-05, + "loss": 0.09564646482467651, + "mean_token_accuracy": 0.9679084822535515, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.27878295491601146, + "eval_loss": 0.7519959211349487, + "eval_mean_token_accuracy": 0.8510654949864676, + "eval_num_tokens": 6397720.0, + "eval_runtime": 85.9109, + "eval_samples_per_second": 16.005, + "eval_steps_per_second": 2.002, + "step": 2740 + }, + { + "entropy": 0.16824879590421915, + "epoch": 6.866749688667497, + "grad_norm": 0.6681098937988281, + "learning_rate": 6.131198137800108e-05, + "loss": 0.0962279736995697, + "mean_token_accuracy": 0.966830012947321, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.2834690434121808, + "eval_loss": 0.751922070980072, + "eval_mean_token_accuracy": 0.8521237577809844, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.3618, + "eval_samples_per_second": 15.921, + "eval_steps_per_second": 1.992, + "step": 2760 + }, + { + "entropy": 0.1518704930320382, + "epoch": 6.916562889165629, + "grad_norm": 0.5201290249824524, + "learning_rate": 5.957332590312513e-05, + "loss": 0.09010660648345947, + "mean_token_accuracy": 0.9693463340401649, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.28485129617674404, + "eval_loss": 0.7452457547187805, + "eval_mean_token_accuracy": 0.8512036796919135, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.4524, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.99, + "step": 2780 + }, + { + "entropy": 0.15512610590085388, + "epoch": 6.966376089663761, + "grad_norm": 0.42802050709724426, + "learning_rate": 5.785082532465233e-05, + "loss": 0.09320432543754578, + "mean_token_accuracy": 0.9686134628951549, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.27554594526110693, + "eval_loss": 0.7644653916358948, + "eval_mean_token_accuracy": 0.8513738523389018, + "eval_num_tokens": 6540175.0, + "eval_runtime": 85.7609, + "eval_samples_per_second": 16.033, + "eval_steps_per_second": 2.006, + "step": 2800 + }, + { + "entropy": 0.17524497526196334, + "epoch": 7.01494396014944, + "grad_norm": 0.3330269157886505, + "learning_rate": 5.6144999125263545e-05, + "loss": 0.0895616888999939, + "mean_token_accuracy": 0.9682766932707566, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.2735865569218647, + "eval_loss": 0.768479585647583, + "eval_mean_token_accuracy": 0.8503459383581959, + "eval_num_tokens": 6583767.0, + "eval_runtime": 85.7162, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.007, + "step": 2820 + }, + { + "entropy": 0.1403565663844347, + "epoch": 7.064757160647572, + "grad_norm": 0.35613498091697693, + "learning_rate": 5.4456361758874235e-05, + "loss": 0.07551313638687134, + "mean_token_accuracy": 0.9739301167428493, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.25941789089593775, + "eval_loss": 0.8209511637687683, + "eval_mean_token_accuracy": 0.8505055855873019, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.0943, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 2840 + }, + { + "entropy": 0.13500106502324344, + "epoch": 7.114570361145703, + "grad_norm": 0.34418627619743347, + "learning_rate": 5.2785422495482234e-05, + "loss": 0.07293946146965027, + "mean_token_accuracy": 0.9747208289802074, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.26482899772912954, + "eval_loss": 0.798904538154602, + "eval_mean_token_accuracy": 0.8511530233677044, + "eval_num_tokens": 6672946.0, + "eval_runtime": 85.7915, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.005, + "step": 2860 + }, + { + "entropy": 0.13127502552233636, + "epoch": 7.164383561643835, + "grad_norm": 0.4638441503047943, + "learning_rate": 5.113268526757892e-05, + "loss": 0.07121461629867554, + "mean_token_accuracy": 0.9756786689162255, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2645381211714689, + "eval_loss": 0.809101939201355, + "eval_mean_token_accuracy": 0.8514727898115335, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.84, + "eval_samples_per_second": 16.018, + "eval_steps_per_second": 2.004, + "step": 2880 + }, + { + "entropy": 0.1331390908919275, + "epoch": 7.214196762141968, + "grad_norm": 0.40206775069236755, + "learning_rate": 4.949864851817007e-05, + "loss": 0.07188264131546021, + "mean_token_accuracy": 0.9755406074225903, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.26244733283339544, + "eval_loss": 0.8143188953399658, + "eval_mean_token_accuracy": 0.8514358189909957, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.8546, + "eval_samples_per_second": 16.015, + "eval_steps_per_second": 2.003, + "step": 2900 + }, + { + "entropy": 0.13647331558167936, + "epoch": 7.2640099626401, + "grad_norm": 0.26405787467956543, + "learning_rate": 4.788380505045224e-05, + "loss": 0.07412450313568116, + "mean_token_accuracy": 0.9744274213910102, + "num_tokens": 6809678.0, + "step": 2920 + }, + { + "epoch": 7.2640099626401, + "eval_entropy": 0.2626111418182074, + "eval_loss": 0.8111525177955627, + "eval_mean_token_accuracy": 0.8512121695418691, + "eval_num_tokens": 6809678.0, + "eval_runtime": 85.9626, + "eval_samples_per_second": 15.995, + "eval_steps_per_second": 2.001, + "step": 2920 + }, + { + "entropy": 0.12644002586603165, + "epoch": 7.313823163138232, + "grad_norm": 0.27514681220054626, + "learning_rate": 4.6288641879189884e-05, + "loss": 0.06807711124420165, + "mean_token_accuracy": 0.9760703906416893, + "num_tokens": 6860750.0, + "step": 2940 + }, + { + "epoch": 7.313823163138232, + "eval_entropy": 0.26096762734097106, + "eval_loss": 0.8184595108032227, + "eval_mean_token_accuracy": 0.8501476153384807, + "eval_num_tokens": 6860750.0, + "eval_runtime": 85.9521, + "eval_samples_per_second": 15.997, + "eval_steps_per_second": 2.001, + "step": 2940 + }, + { + "entropy": 0.13920630998909472, + "epoch": 7.363636363636363, + "grad_norm": 0.23584705591201782, + "learning_rate": 4.4713640083838604e-05, + "loss": 0.07301607131958007, + "mean_token_accuracy": 0.9745715200901032, + "num_tokens": 6907092.0, + "step": 2960 + }, + { + "epoch": 7.363636363636363, + "eval_entropy": 0.2612536767021168, + "eval_loss": 0.8116245269775391, + "eval_mean_token_accuracy": 0.8510967350976412, + "eval_num_tokens": 6907092.0, + "eval_runtime": 85.6373, + "eval_samples_per_second": 16.056, + "eval_steps_per_second": 2.008, + "step": 2960 + }, + { + "entropy": 0.1349492883309722, + "epoch": 7.4134495641344955, + "grad_norm": 0.24552719295024872, + "learning_rate": 4.315927466345791e-05, + "loss": 0.07397544980049134, + "mean_token_accuracy": 0.9745095103979111, + "num_tokens": 6952700.0, + "step": 2980 + }, + { + "epoch": 7.4134495641344955, + "eval_entropy": 0.25796533306670744, + "eval_loss": 0.8266491293907166, + "eval_mean_token_accuracy": 0.8511653857868772, + "eval_num_tokens": 6952700.0, + "eval_runtime": 85.7462, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.006, + "step": 2980 + }, + { + "entropy": 0.14479175000451505, + "epoch": 7.463262764632628, + "grad_norm": 0.2846072018146515, + "learning_rate": 4.162601439345814e-05, + "loss": 0.07544798254966736, + "mean_token_accuracy": 0.9727819666266442, + "num_tokens": 6996430.0, + "step": 3000 + }, + { + "epoch": 7.463262764632628, + "eval_entropy": 0.2584348309698493, + "eval_loss": 0.8253348469734192, + "eval_mean_token_accuracy": 0.8511569815319638, + "eval_num_tokens": 6996430.0, + "eval_runtime": 86.2984, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 3000 + }, + { + "entropy": 0.14114196319133043, + "epoch": 7.51307596513076, + "grad_norm": 0.407966285943985, + "learning_rate": 4.011432168422419e-05, + "loss": 0.0736398994922638, + "mean_token_accuracy": 0.9741654269397259, + "num_tokens": 7042038.0, + "step": 3020 + }, + { + "epoch": 7.51307596513076, + "eval_entropy": 0.25232676260693127, + "eval_loss": 0.8296052813529968, + "eval_mean_token_accuracy": 0.8523298349491385, + "eval_num_tokens": 7042038.0, + "eval_runtime": 85.8445, + "eval_samples_per_second": 16.017, + "eval_steps_per_second": 2.004, + "step": 3020 + }, + { + "entropy": 0.1353456223383546, + "epoch": 7.562889165628892, + "grad_norm": 0.2712634801864624, + "learning_rate": 3.8624652441658684e-05, + "loss": 0.07362412214279175, + "mean_token_accuracy": 0.9747945807874203, + "num_tokens": 7089390.0, + "step": 3040 + }, + { + "epoch": 7.562889165628892, + "eval_entropy": 0.2579477243991785, + "eval_loss": 0.8274564743041992, + "eval_mean_token_accuracy": 0.8517705212498821, + "eval_num_tokens": 7089390.0, + "eval_runtime": 85.8222, + "eval_samples_per_second": 16.022, + "eval_steps_per_second": 2.004, + "step": 3040 + }, + { + "entropy": 0.1296080862637609, + "epoch": 7.6127023661270234, + "grad_norm": 0.2371893972158432, + "learning_rate": 3.715745592968707e-05, + "loss": 0.06971035599708557, + "mean_token_accuracy": 0.9759043246507645, + "num_tokens": 7138002.0, + "step": 3060 + }, + { + "epoch": 7.6127023661270234, + "eval_entropy": 0.25391967083479083, + "eval_loss": 0.8197130560874939, + "eval_mean_token_accuracy": 0.8522267875283264, + "eval_num_tokens": 7138002.0, + "eval_runtime": 85.8796, + "eval_samples_per_second": 16.011, + "eval_steps_per_second": 2.003, + "step": 3060 + }, + { + "entropy": 0.1311203008517623, + "epoch": 7.662515566625156, + "grad_norm": 0.22499267756938934, + "learning_rate": 3.5713174634765967e-05, + "loss": 0.07176244258880615, + "mean_token_accuracy": 0.9754939571022987, + "num_tokens": 7185520.0, + "step": 3080 + }, + { + "epoch": 7.662515566625156, + "eval_entropy": 0.2526215241225653, + "eval_loss": 0.8265154361724854, + "eval_mean_token_accuracy": 0.8519952584837758, + "eval_num_tokens": 7185520.0, + "eval_runtime": 85.8746, + "eval_samples_per_second": 16.012, + "eval_steps_per_second": 2.003, + "step": 3080 + }, + { + "entropy": 0.13420484317466616, + "epoch": 7.712328767123288, + "grad_norm": 0.2398064285516739, + "learning_rate": 3.4292244132434866e-05, + "loss": 0.07559212446212768, + "mean_token_accuracy": 0.9743142127990723, + "num_tokens": 7232170.0, + "step": 3100 + }, + { + "epoch": 7.712328767123288, + "eval_entropy": 0.2484562756537005, + "eval_loss": 0.8312150239944458, + "eval_mean_token_accuracy": 0.8528405119513356, + "eval_num_tokens": 7232170.0, + "eval_runtime": 85.7896, + "eval_samples_per_second": 16.028, + "eval_steps_per_second": 2.005, + "step": 3100 + }, + { + "entropy": 0.11965563679113984, + "epoch": 7.76214196762142, + "grad_norm": 0.3408384919166565, + "learning_rate": 3.2895092955952746e-05, + "loss": 0.0661750853061676, + "mean_token_accuracy": 0.9776600524783134, + "num_tokens": 7282846.0, + "step": 3120 + }, + { + "epoch": 7.76214196762142, + "eval_entropy": 0.2522421533804993, + "eval_loss": 0.8327009677886963, + "eval_mean_token_accuracy": 0.8524222023958383, + "eval_num_tokens": 7282846.0, + "eval_runtime": 86.1769, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 1.996, + "step": 3120 + }, + { + "entropy": 0.13388084415346385, + "epoch": 7.811955168119551, + "grad_norm": 0.35418516397476196, + "learning_rate": 3.152214246705829e-05, + "loss": 0.07149899601936341, + "mean_token_accuracy": 0.9747635535895824, + "num_tokens": 7331518.0, + "step": 3140 + }, + { + "epoch": 7.811955168119551, + "eval_entropy": 0.25038352296795957, + "eval_loss": 0.836457371711731, + "eval_mean_token_accuracy": 0.8526130665180295, + "eval_num_tokens": 7331518.0, + "eval_runtime": 85.6099, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.009, + "step": 3140 + }, + { + "entropy": 0.13530643959529698, + "epoch": 7.861768368617684, + "grad_norm": 0.38060539960861206, + "learning_rate": 3.017380672889291e-05, + "loss": 0.07116585969924927, + "mean_token_accuracy": 0.973284512758255, + "num_tokens": 7379056.0, + "step": 3160 + }, + { + "epoch": 7.861768368617684, + "eval_entropy": 0.255092611319797, + "eval_loss": 0.8314701914787292, + "eval_mean_token_accuracy": 0.8520913099826768, + "eval_num_tokens": 7379056.0, + "eval_runtime": 85.877, + "eval_samples_per_second": 16.011, + "eval_steps_per_second": 2.003, + "step": 3160 + }, + { + "entropy": 0.13383390177041293, + "epoch": 7.911581569115816, + "grad_norm": 0.3827536106109619, + "learning_rate": 2.8850492381124808e-05, + "loss": 0.07305437326431274, + "mean_token_accuracy": 0.9750778004527092, + "num_tokens": 7424770.0, + "step": 3180 + }, + { + "epoch": 7.911581569115816, + "eval_entropy": 0.25416371157003004, + "eval_loss": 0.8206402063369751, + "eval_mean_token_accuracy": 0.852779901651449, + "eval_num_tokens": 7424770.0, + "eval_runtime": 86.1015, + "eval_samples_per_second": 15.97, + "eval_steps_per_second": 1.998, + "step": 3180 + }, + { + "entropy": 0.1395680439658463, + "epoch": 7.961394769613948, + "grad_norm": 0.3809775412082672, + "learning_rate": 2.7552598517312256e-05, + "loss": 0.07236042022705078, + "mean_token_accuracy": 0.9731538116931915, + "num_tokens": 7470804.0, + "step": 3200 + }, + { + "epoch": 7.961394769613948, + "eval_entropy": 0.25528111975899964, + "eval_loss": 0.8230037093162537, + "eval_mean_token_accuracy": 0.8526452603035195, + "eval_num_tokens": 7470804.0, + "eval_runtime": 85.7895, + "eval_samples_per_second": 16.028, + "eval_steps_per_second": 2.005, + "step": 3200 + }, + { + "entropy": 0.12193699864049752, + "epoch": 8.009962640099626, + "grad_norm": 0.11854425817728043, + "learning_rate": 2.6280516564542205e-05, + "loss": 0.06617764234542847, + "mean_token_accuracy": 0.977179691577569, + "num_tokens": 7518110.0, + "step": 3220 + }, + { + "epoch": 8.009962640099626, + "eval_entropy": 0.25100527677771656, + "eval_loss": 0.8393343687057495, + "eval_mean_token_accuracy": 0.8522553132023922, + "eval_num_tokens": 7518110.0, + "eval_runtime": 85.8837, + "eval_samples_per_second": 16.01, + "eval_steps_per_second": 2.003, + "step": 3220 + }, + { + "entropy": 0.12788885813206435, + "epoch": 8.059775840597759, + "grad_norm": 0.16094881296157837, + "learning_rate": 2.50346301653812e-05, + "loss": 0.06274186968803405, + "mean_token_accuracy": 0.9766994707286358, + "num_tokens": 7565539.0, + "step": 3240 + }, + { + "epoch": 8.059775840597759, + "eval_entropy": 0.24409458682287571, + "eval_loss": 0.874617338180542, + "eval_mean_token_accuracy": 0.8521041180505309, + "eval_num_tokens": 7565539.0, + "eval_runtime": 86.2656, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 3240 + }, + { + "entropy": 0.12464155335910618, + "epoch": 8.10958904109589, + "grad_norm": 0.16893954575061798, + "learning_rate": 2.381531506217437e-05, + "loss": 0.06093020439147949, + "mean_token_accuracy": 0.9776258453726768, + "num_tokens": 7612578.0, + "step": 3260 + }, + { + "epoch": 8.10958904109589, + "eval_entropy": 0.24396493017326953, + "eval_loss": 0.891161322593689, + "eval_mean_token_accuracy": 0.8515338024427724, + "eval_num_tokens": 7612578.0, + "eval_runtime": 85.9061, + "eval_samples_per_second": 16.006, + "eval_steps_per_second": 2.002, + "step": 3260 + }, + { + "entropy": 0.12345920228399336, + "epoch": 8.159402241594023, + "grad_norm": 0.14332273602485657, + "learning_rate": 2.262293898372616e-05, + "loss": 0.061289966106414795, + "mean_token_accuracy": 0.9762230902910233, + "num_tokens": 7660157.0, + "step": 3280 + }, + { + "epoch": 8.159402241594023, + "eval_entropy": 0.2481445314059424, + "eval_loss": 0.8922848105430603, + "eval_mean_token_accuracy": 0.8514944855556932, + "eval_num_tokens": 7660157.0, + "eval_runtime": 85.5201, + "eval_samples_per_second": 16.078, + "eval_steps_per_second": 2.011, + "step": 3280 + }, + { + "entropy": 0.12298110066913068, + "epoch": 8.209215442092155, + "grad_norm": 0.21848882734775543, + "learning_rate": 2.1457861534398633e-05, + "loss": 0.05986443758010864, + "mean_token_accuracy": 0.9786281704902648, + "num_tokens": 7709745.0, + "step": 3300 + }, + { + "epoch": 8.209215442092155, + "eval_entropy": 0.24329388124305149, + "eval_loss": 0.9021085500717163, + "eval_mean_token_accuracy": 0.8521762625422589, + "eval_num_tokens": 7709745.0, + "eval_runtime": 85.955, + "eval_samples_per_second": 15.997, + "eval_steps_per_second": 2.001, + "step": 3300 + }, + { + "entropy": 0.13265180448070168, + "epoch": 8.259028642590286, + "grad_norm": 0.18067947030067444, + "learning_rate": 2.0320434085659692e-05, + "loss": 0.06724961400032044, + "mean_token_accuracy": 0.975098168104887, + "num_tokens": 7753571.0, + "step": 3320 + }, + { + "epoch": 8.259028642590286, + "eval_entropy": 0.2433211464694766, + "eval_loss": 0.9094350337982178, + "eval_mean_token_accuracy": 0.8520150094531304, + "eval_num_tokens": 7753571.0, + "eval_runtime": 85.7989, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.005, + "step": 3320 + }, + { + "entropy": 0.11949320202693343, + "epoch": 8.308841843088418, + "grad_norm": 0.17020289599895477, + "learning_rate": 1.9210999670114196e-05, + "loss": 0.0634455680847168, + "mean_token_accuracy": 0.9771294385194779, + "num_tokens": 7799310.0, + "step": 3340 + }, + { + "epoch": 8.308841843088418, + "eval_entropy": 0.24345201219237128, + "eval_loss": 0.9021793603897095, + "eval_mean_token_accuracy": 0.8520745697409607, + "eval_num_tokens": 7799310.0, + "eval_runtime": 86.0883, + "eval_samples_per_second": 15.972, + "eval_steps_per_second": 1.998, + "step": 3340 + }, + { + "entropy": 0.12065747743472457, + "epoch": 8.35865504358655, + "grad_norm": 0.16789060831069946, + "learning_rate": 1.8129892878049886e-05, + "loss": 0.061494195461273195, + "mean_token_accuracy": 0.9779584899544715, + "num_tokens": 7846447.0, + "step": 3360 + }, + { + "epoch": 8.35865504358655, + "eval_entropy": 0.24093415042342142, + "eval_loss": 0.9006755352020264, + "eval_mean_token_accuracy": 0.852174230786257, + "eval_num_tokens": 7846447.0, + "eval_runtime": 85.9011, + "eval_samples_per_second": 16.007, + "eval_steps_per_second": 2.002, + "step": 3360 + }, + { + "entropy": 0.13125578537583352, + "epoch": 8.408468244084682, + "grad_norm": 0.1662452220916748, + "learning_rate": 1.70774397565298e-05, + "loss": 0.06685600876808166, + "mean_token_accuracy": 0.9744067586958408, + "num_tokens": 7890283.0, + "step": 3380 + }, + { + "epoch": 8.408468244084682, + "eval_entropy": 0.24062153688350388, + "eval_loss": 0.9078915119171143, + "eval_mean_token_accuracy": 0.8523201647886011, + "eval_num_tokens": 7890283.0, + "eval_runtime": 86.0201, + "eval_samples_per_second": 15.985, + "eval_steps_per_second": 2.0, + "step": 3380 + }, + { + "entropy": 0.11986117120832204, + "epoch": 8.458281444582815, + "grad_norm": 0.19571948051452637, + "learning_rate": 1.6053957711060606e-05, + "loss": 0.06411095261573792, + "mean_token_accuracy": 0.9770627245306969, + "num_tokens": 7936518.0, + "step": 3400 + }, + { + "epoch": 8.458281444582815, + "eval_entropy": 0.24352820347561394, + "eval_loss": 0.9058943390846252, + "eval_mean_token_accuracy": 0.8519382792156797, + "eval_num_tokens": 7936518.0, + "eval_runtime": 85.966, + "eval_samples_per_second": 15.995, + "eval_steps_per_second": 2.001, + "step": 3400 + }, + { + "entropy": 0.12857897616922856, + "epoch": 8.508094645080947, + "grad_norm": 0.2609264850616455, + "learning_rate": 1.5059755409867613e-05, + "loss": 0.06473397612571716, + "mean_token_accuracy": 0.9764650195837021, + "num_tokens": 7981966.0, + "step": 3420 + }, + { + "epoch": 8.508094645080947, + "eval_entropy": 0.24032609000108962, + "eval_loss": 0.9077776074409485, + "eval_mean_token_accuracy": 0.8517829197090726, + "eval_num_tokens": 7981966.0, + "eval_runtime": 86.6059, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 3420 + }, + { + "entropy": 0.12348870886489749, + "epoch": 8.557907845579079, + "grad_norm": 0.19537609815597534, + "learning_rate": 1.409513269080473e-05, + "loss": 0.06481348872184753, + "mean_token_accuracy": 0.9769559659063816, + "num_tokens": 8028367.0, + "step": 3440 + }, + { + "epoch": 8.557907845579079, + "eval_entropy": 0.2404322574824788, + "eval_loss": 0.9057720899581909, + "eval_mean_token_accuracy": 0.8521037981953732, + "eval_num_tokens": 8028367.0, + "eval_runtime": 86.166, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.996, + "step": 3440 + }, + { + "entropy": 0.12040232736617326, + "epoch": 8.607721046077211, + "grad_norm": 0.3310582935810089, + "learning_rate": 1.3160380470927183e-05, + "loss": 0.06468871235847473, + "mean_token_accuracy": 0.9768650442361831, + "num_tokens": 8074934.0, + "step": 3460 + }, + { + "epoch": 8.607721046077211, + "eval_entropy": 0.24118655876711356, + "eval_loss": 0.9028318524360657, + "eval_mean_token_accuracy": 0.8521025340224422, + "eval_num_tokens": 8074934.0, + "eval_runtime": 85.3668, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.015, + "step": 3460 + }, + { + "entropy": 0.12328103906475008, + "epoch": 8.657534246575342, + "grad_norm": 0.12836167216300964, + "learning_rate": 1.2255780658755122e-05, + "loss": 0.06229386329650879, + "mean_token_accuracy": 0.9763277888298034, + "num_tokens": 8122775.0, + "step": 3480 + }, + { + "epoch": 8.657534246575342, + "eval_entropy": 0.24194598145956217, + "eval_loss": 0.9009329080581665, + "eval_mean_token_accuracy": 0.8521693289973015, + "eval_num_tokens": 8122775.0, + "eval_runtime": 85.9415, + "eval_samples_per_second": 15.999, + "eval_steps_per_second": 2.001, + "step": 3480 + }, + { + "entropy": 0.11321646976284683, + "epoch": 8.707347447073474, + "grad_norm": 0.15656894445419312, + "learning_rate": 1.1381606069253786e-05, + "loss": 0.05908188819885254, + "mean_token_accuracy": 0.9779504477977753, + "num_tokens": 8174307.0, + "step": 3500 + }, + { + "epoch": 8.707347447073474, + "eval_entropy": 0.24121542517528977, + "eval_loss": 0.9016091823577881, + "eval_mean_token_accuracy": 0.8521790667328724, + "eval_num_tokens": 8174307.0, + "eval_runtime": 85.7465, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.006, + "step": 3500 + }, + { + "entropy": 0.12657046681270004, + "epoch": 8.757160647571606, + "grad_norm": 0.22597502171993256, + "learning_rate": 1.053812034155629e-05, + "loss": 0.06244581937789917, + "mean_token_accuracy": 0.976795207709074, + "num_tokens": 8222808.0, + "step": 3520 + }, + { + "epoch": 8.757160647571606, + "eval_entropy": 0.23877542708502258, + "eval_loss": 0.9069110155105591, + "eval_mean_token_accuracy": 0.8522880177858264, + "eval_num_tokens": 8222808.0, + "eval_runtime": 85.7792, + "eval_samples_per_second": 16.03, + "eval_steps_per_second": 2.005, + "step": 3520 + }, + { + "entropy": 0.11422101808711886, + "epoch": 8.806973848069738, + "grad_norm": 0.21139323711395264, + "learning_rate": 9.725577859453502e-06, + "loss": 0.05988085865974426, + "mean_token_accuracy": 0.9779510758817196, + "num_tokens": 8273335.0, + "step": 3540 + }, + { + "epoch": 8.806973848069738, + "eval_entropy": 0.2393161087881687, + "eval_loss": 0.9033801555633545, + "eval_mean_token_accuracy": 0.8522614209457885, + "eval_num_tokens": 8273335.0, + "eval_runtime": 85.5594, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 3540 + }, + { + "entropy": 0.13810604228638113, + "epoch": 8.85678704856787, + "grad_norm": 0.24571993947029114, + "learning_rate": 8.944223674675537e-06, + "loss": 0.07036117911338806, + "mean_token_accuracy": 0.9734892748296261, + "num_tokens": 8315235.0, + "step": 3560 + }, + { + "epoch": 8.85678704856787, + "eval_entropy": 0.23998506947658782, + "eval_loss": 0.9009848833084106, + "eval_mean_token_accuracy": 0.8521793619837872, + "eval_num_tokens": 8315235.0, + "eval_runtime": 86.0974, + "eval_samples_per_second": 15.97, + "eval_steps_per_second": 1.998, + "step": 3560 + }, + { + "entropy": 0.14193559321574867, + "epoch": 8.906600249066003, + "grad_norm": 0.17304112017154694, + "learning_rate": 8.194293432987386e-06, + "loss": 0.07077967524528503, + "mean_token_accuracy": 0.973305893689394, + "num_tokens": 8358099.0, + "step": 3580 + }, + { + "epoch": 8.906600249066003, + "eval_entropy": 0.23883876689644748, + "eval_loss": 0.9015622138977051, + "eval_mean_token_accuracy": 0.8524864378363587, + "eval_num_tokens": 8358099.0, + "eval_runtime": 86.0089, + "eval_samples_per_second": 15.987, + "eval_steps_per_second": 2.0, + "step": 3580 + }, + { + "entropy": 0.11878943420015275, + "epoch": 8.956413449564135, + "grad_norm": 0.19075658917427063, + "learning_rate": 7.476013303121426e-06, + "loss": 0.060806107521057126, + "mean_token_accuracy": 0.9776863709092141, + "num_tokens": 8407430.0, + "step": 3600 + }, + { + "epoch": 8.956413449564135, + "eval_entropy": 0.23726526309931, + "eval_loss": 0.9060276746749878, + "eval_mean_token_accuracy": 0.8524192058762838, + "eval_num_tokens": 8407430.0, + "eval_runtime": 85.7252, + "eval_samples_per_second": 16.04, + "eval_steps_per_second": 2.006, + "step": 3600 + }, + { + "entropy": 0.1255835090787747, + "epoch": 9.004981320049813, + "grad_norm": 0.11608047038316727, + "learning_rate": 6.78959990856799e-06, + "loss": 0.06319612860679627, + "mean_token_accuracy": 0.9766685519462976, + "num_tokens": 8453175.0, + "step": 3620 + }, + { + "epoch": 9.004981320049813, + "eval_entropy": 0.2373251837006835, + "eval_loss": 0.9045722484588623, + "eval_mean_token_accuracy": 0.8525558363559634, + "eval_num_tokens": 8453175.0, + "eval_runtime": 85.7435, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.006, + "step": 3620 + }, + { + "entropy": 0.12587778437882663, + "epoch": 9.054794520547945, + "grad_norm": 0.1564614623785019, + "learning_rate": 6.135260262244683e-06, + "loss": 0.0630365788936615, + "mean_token_accuracy": 0.9777486085891723, + "num_tokens": 8497151.0, + "step": 3640 + }, + { + "epoch": 9.054794520547945, + "eval_entropy": 0.23559923721260803, + "eval_loss": 0.9120694398880005, + "eval_mean_token_accuracy": 0.8525292966947999, + "eval_num_tokens": 8497151.0, + "eval_runtime": 85.8018, + "eval_samples_per_second": 16.025, + "eval_steps_per_second": 2.005, + "step": 3640 + }, + { + "entropy": 0.12535365503281354, + "epoch": 9.104607721046078, + "grad_norm": 0.1404249221086502, + "learning_rate": 5.513191704064086e-06, + "loss": 0.060502654314041136, + "mean_token_accuracy": 0.9770058333873749, + "num_tokens": 8542996.0, + "step": 3660 + }, + { + "epoch": 9.104607721046078, + "eval_entropy": 0.23525122691725575, + "eval_loss": 0.9182237982749939, + "eval_mean_token_accuracy": 0.8524098333924316, + "eval_num_tokens": 8542996.0, + "eval_runtime": 85.9872, + "eval_samples_per_second": 15.991, + "eval_steps_per_second": 2.0, + "step": 3660 + }, + { + "entropy": 0.11330419047735632, + "epoch": 9.15442092154421, + "grad_norm": 0.15513843297958374, + "learning_rate": 4.92358184141876e-06, + "loss": 0.05822383761405945, + "mean_token_accuracy": 0.9793384782969952, + "num_tokens": 8591625.0, + "step": 3680 + }, + { + "epoch": 9.15442092154421, + "eval_entropy": 0.2353947116711805, + "eval_loss": 0.9229223132133484, + "eval_mean_token_accuracy": 0.852500357253607, + "eval_num_tokens": 8591625.0, + "eval_runtime": 86.0805, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.998, + "step": 3680 + }, + { + "entropy": 0.11830627010203898, + "epoch": 9.204234122042342, + "grad_norm": 0.1730550080537796, + "learning_rate": 4.366608492601456e-06, + "loss": 0.05860854983329773, + "mean_token_accuracy": 0.9779663667082786, + "num_tokens": 8639845.0, + "step": 3700 + }, + { + "epoch": 9.204234122042342, + "eval_entropy": 0.23567205719476522, + "eval_loss": 0.9269373416900635, + "eval_mean_token_accuracy": 0.8523658004611038, + "eval_num_tokens": 8639845.0, + "eval_runtime": 85.9809, + "eval_samples_per_second": 15.992, + "eval_steps_per_second": 2.0, + "step": 3700 + }, + { + "entropy": 0.1180900705512613, + "epoch": 9.254047322540472, + "grad_norm": 0.20909737050533295, + "learning_rate": 3.842439633177387e-06, + "loss": 0.059438884258270264, + "mean_token_accuracy": 0.9786856278777123, + "num_tokens": 8687194.0, + "step": 3720 + }, + { + "epoch": 9.254047322540472, + "eval_entropy": 0.23602714493524196, + "eval_loss": 0.9293538928031921, + "eval_mean_token_accuracy": 0.8523273440294488, + "eval_num_tokens": 8687194.0, + "eval_runtime": 85.2118, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.019, + "step": 3720 + }, + { + "entropy": 0.13156692241318524, + "epoch": 9.303860523038605, + "grad_norm": 0.12535709142684937, + "learning_rate": 3.3512333453253305e-06, + "loss": 0.06337688565254211, + "mean_token_accuracy": 0.9756712593138218, + "num_tokens": 8731721.0, + "step": 3740 + }, + { + "epoch": 9.303860523038605, + "eval_entropy": 0.23534389351343, + "eval_loss": 0.932999312877655, + "eval_mean_token_accuracy": 0.8523333925147389, + "eval_num_tokens": 8731721.0, + "eval_runtime": 85.953, + "eval_samples_per_second": 15.997, + "eval_steps_per_second": 2.001, + "step": 3740 + }, + { + "entropy": 0.12327516414225101, + "epoch": 9.353673723536737, + "grad_norm": 0.16341575980186462, + "learning_rate": 2.8931377701619306e-06, + "loss": 0.05869622826576233, + "mean_token_accuracy": 0.9784224212169648, + "num_tokens": 8778614.0, + "step": 3760 + }, + { + "epoch": 9.353673723536737, + "eval_entropy": 0.23493653622477553, + "eval_loss": 0.9358566999435425, + "eval_mean_token_accuracy": 0.8522722783476807, + "eval_num_tokens": 8778614.0, + "eval_runtime": 85.2538, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.018, + "step": 3760 + }, + { + "entropy": 0.1134357453789562, + "epoch": 9.403486924034869, + "grad_norm": 0.23999616503715515, + "learning_rate": 2.4682910630645723e-06, + "loss": 0.057540220022201535, + "mean_token_accuracy": 0.9798057802021504, + "num_tokens": 8826551.0, + "step": 3780 + }, + { + "epoch": 9.403486924034869, + "eval_entropy": 0.23470525634150172, + "eval_loss": 0.937556266784668, + "eval_mean_token_accuracy": 0.8523351706044618, + "eval_num_tokens": 8826551.0, + "eval_runtime": 85.7764, + "eval_samples_per_second": 16.03, + "eval_steps_per_second": 2.005, + "step": 3780 + }, + { + "entropy": 0.1075570048764348, + "epoch": 9.453300124533001, + "grad_norm": 0.15417765080928802, + "learning_rate": 2.0768213520055406e-06, + "loss": 0.05581026673316956, + "mean_token_accuracy": 0.9797527104616165, + "num_tokens": 8876556.0, + "step": 3800 + }, + { + "epoch": 9.453300124533001, + "eval_entropy": 0.2347462713545145, + "eval_loss": 0.9383137226104736, + "eval_mean_token_accuracy": 0.8522575324357942, + "eval_num_tokens": 8876556.0, + "eval_runtime": 85.8985, + "eval_samples_per_second": 16.007, + "eval_steps_per_second": 2.002, + "step": 3800 + }, + { + "entropy": 0.12609313456341625, + "epoch": 9.503113325031133, + "grad_norm": 0.22041426599025726, + "learning_rate": 1.7188466989102739e-06, + "loss": 0.06379218697547913, + "mean_token_accuracy": 0.9763593293726445, + "num_tokens": 8920286.0, + "step": 3820 + }, + { + "epoch": 9.503113325031133, + "eval_entropy": 0.23459658849724505, + "eval_loss": 0.9393337965011597, + "eval_mean_token_accuracy": 0.8523633532052817, + "eval_num_tokens": 8920286.0, + "eval_runtime": 85.9348, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.002, + "step": 3820 + }, + { + "entropy": 0.12149709439836442, + "epoch": 9.552926525529266, + "grad_norm": 0.16608643531799316, + "learning_rate": 1.3944750640516357e-06, + "loss": 0.06341606974601746, + "mean_token_accuracy": 0.9771503552794456, + "num_tokens": 8964464.0, + "step": 3840 + }, + { + "epoch": 9.552926525529266, + "eval_entropy": 0.2347291322468325, + "eval_loss": 0.9399036765098572, + "eval_mean_token_accuracy": 0.8523768914300341, + "eval_num_tokens": 8964464.0, + "eval_runtime": 86.1305, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.997, + "step": 3840 + }, + { + "entropy": 0.11724846777506173, + "epoch": 9.602739726027398, + "grad_norm": 0.13613300025463104, + "learning_rate": 1.103804273490497e-06, + "loss": 0.05994418263435364, + "mean_token_accuracy": 0.9778759330511093, + "num_tokens": 9010414.0, + "step": 3860 + }, + { + "epoch": 9.602739726027398, + "eval_entropy": 0.23495923337894817, + "eval_loss": 0.9400841593742371, + "eval_mean_token_accuracy": 0.8523780471363733, + "eval_num_tokens": 9010414.0, + "eval_runtime": 86.0379, + "eval_samples_per_second": 15.981, + "eval_steps_per_second": 1.999, + "step": 3860 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.804764090573476e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3880/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3880/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3880/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3880/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3880/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3880/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3880/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3880/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3880/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3880/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3880/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3880/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3880/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3880/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..9717e2f7f0eb6f6b68099b17339ee4f9e942668c --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3880/trainer_state.json @@ -0,0 +1,4108 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 9.65255292652553, + "eval_steps": 20, + "global_step": 3880, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + }, + { + "entropy": 0.561330484598875, + "epoch": 1.891656288916563, + "grad_norm": 0.6722865700721741, + "learning_rate": 0.0002208867897174789, + "loss": 0.499837589263916, + "mean_token_accuracy": 0.8518734864890576, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.5865232653396074, + "eval_loss": 0.5437926650047302, + "eval_mean_token_accuracy": 0.8450997017843779, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4116, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.547389242425561, + "epoch": 1.9414694894146949, + "grad_norm": 0.7935577034950256, + "learning_rate": 0.00022027119820226907, + "loss": 0.4977591514587402, + "mean_token_accuracy": 0.8539491161704064, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.5290903090391048, + "eval_loss": 0.5409526824951172, + "eval_mean_token_accuracy": 0.8497545698354411, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.7262, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 780 + }, + { + "entropy": 0.5687909748405218, + "epoch": 1.9912826899128269, + "grad_norm": 0.6180546283721924, + "learning_rate": 0.00021962329729698345, + "loss": 0.5109643459320068, + "mean_token_accuracy": 0.8521598495543004, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.5503541858390321, + "eval_loss": 0.5361555218696594, + "eval_mean_token_accuracy": 0.8510884285666221, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.3339, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 800 + }, + { + "entropy": 0.4739728841261986, + "epoch": 2.0398505603985058, + "grad_norm": 0.8058829307556152, + "learning_rate": 0.0002189432823996982, + "loss": 0.4204097747802734, + "mean_token_accuracy": 0.8728981889211215, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.5077334992414297, + "eval_loss": 0.5531114339828491, + "eval_mean_token_accuracy": 0.8489257208136625, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.4801, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.989, + "step": 820 + }, + { + "entropy": 0.4594309840351343, + "epoch": 2.0896637608966375, + "grad_norm": 0.6906896829605103, + "learning_rate": 0.0002182313585936314, + "loss": 0.4071959495544434, + "mean_token_accuracy": 0.8732857562601566, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.49850136994622474, + "eval_loss": 0.5486204624176025, + "eval_mean_token_accuracy": 0.8507991450470548, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.3364, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.4881629109382629, + "epoch": 2.1394769613947697, + "grad_norm": 0.6343470215797424, + "learning_rate": 0.0002174877405852928, + "loss": 0.41669540405273436, + "mean_token_accuracy": 0.8711295068264008, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.49155513924914734, + "eval_loss": 0.555109441280365, + "eval_mean_token_accuracy": 0.8496399400539176, + "eval_num_tokens": 2008562.0, + "eval_runtime": 86.3295, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 860 + }, + { + "entropy": 0.4648668970912695, + "epoch": 2.1892901618929015, + "grad_norm": 0.8014165163040161, + "learning_rate": 0.00021671265263973133, + "loss": 0.4110250473022461, + "mean_token_accuracy": 0.8754166305065155, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.4909258722219356, + "eval_loss": 0.5539511442184448, + "eval_mean_token_accuracy": 0.8492401502160138, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.3468, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 880 + }, + { + "entropy": 0.4824485514312983, + "epoch": 2.2391033623910337, + "grad_norm": 0.6665191054344177, + "learning_rate": 0.00021590632851289967, + "loss": 0.4181404113769531, + "mean_token_accuracy": 0.8726993151009083, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.4986876940657926, + "eval_loss": 0.547695517539978, + "eval_mean_token_accuracy": 0.8501384708770486, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.3838, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 900 + }, + { + "entropy": 0.4751896943897009, + "epoch": 2.2889165628891655, + "grad_norm": 0.81158047914505, + "learning_rate": 0.00021506901138115678, + "loss": 0.40689678192138673, + "mean_token_accuracy": 0.8745221219956875, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.507153491121392, + "eval_loss": 0.5501641631126404, + "eval_mean_token_accuracy": 0.8495670116918032, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.0912, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 920 + }, + { + "entropy": 0.4873133715242147, + "epoch": 2.3387297633872977, + "grad_norm": 0.7218056321144104, + "learning_rate": 0.0002142009537679292, + "loss": 0.42701358795166017, + "mean_token_accuracy": 0.8695114746689796, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5202612736543943, + "eval_loss": 0.5491839051246643, + "eval_mean_token_accuracy": 0.8494071208460386, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.1142, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 940 + }, + { + "entropy": 0.4762951169162989, + "epoch": 2.3885429638854294, + "grad_norm": 0.7194424867630005, + "learning_rate": 0.0002133024174675534, + "loss": 0.42299847602844237, + "mean_token_accuracy": 0.8709790132939815, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4899340462546016, + "eval_loss": 0.5522511601448059, + "eval_mean_token_accuracy": 0.8492208258357159, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.463, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 960 + }, + { + "entropy": 0.49650347977876663, + "epoch": 2.4383561643835616, + "grad_norm": 0.8406022787094116, + "learning_rate": 0.0002123736734663221, + "loss": 0.4275330066680908, + "mean_token_accuracy": 0.8670595556497573, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.49691385654515996, + "eval_loss": 0.5491269826889038, + "eval_mean_token_accuracy": 0.850309816210769, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.17, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 980 + }, + { + "entropy": 0.48843890577554705, + "epoch": 2.488169364881694, + "grad_norm": 0.9082473516464233, + "learning_rate": 0.00021141500186075868, + "loss": 0.4309722423553467, + "mean_token_accuracy": 0.8686766296625137, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5543508351195691, + "eval_loss": 0.5478800535202026, + "eval_mean_token_accuracy": 0.8478029522784921, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.3835, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 1000 + }, + { + "entropy": 0.4777219031006098, + "epoch": 2.5379825653798256, + "grad_norm": 0.7448089122772217, + "learning_rate": 0.0002104266917731438, + "loss": 0.423325252532959, + "mean_token_accuracy": 0.8706337086856365, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.49857561550168106, + "eval_loss": 0.5511948466300964, + "eval_mean_token_accuracy": 0.8502220289651737, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.5399, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.988, + "step": 1020 + }, + { + "entropy": 0.4844174191355705, + "epoch": 2.587795765877958, + "grad_norm": 0.794029176235199, + "learning_rate": 0.00020940904126432, + "loss": 0.4176753044128418, + "mean_token_accuracy": 0.873535567522049, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.485467542222766, + "eval_loss": 0.5539286732673645, + "eval_mean_token_accuracy": 0.8495475081510322, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.135, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 1.997, + "step": 1040 + }, + { + "entropy": 0.49070929251611234, + "epoch": 2.6376089663760895, + "grad_norm": 0.7558256983757019, + "learning_rate": 0.0002083623572438007, + "loss": 0.42867293357849123, + "mean_token_accuracy": 0.8696666076779366, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.490822730889154, + "eval_loss": 0.5434785485267639, + "eval_mean_token_accuracy": 0.850568296950917, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.4933, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 1060 + }, + { + "entropy": 0.47806114703416824, + "epoch": 2.6874221668742218, + "grad_norm": 0.6608979105949402, + "learning_rate": 0.00020728695537721047, + "loss": 0.4289727687835693, + "mean_token_accuracy": 0.8693130135536193, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.5285773256490397, + "eval_loss": 0.5444230437278748, + "eval_mean_token_accuracy": 0.8498796481032704, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.7091, + "eval_samples_per_second": 15.858, + "eval_steps_per_second": 1.984, + "step": 1080 + }, + { + "entropy": 0.5046216730028391, + "epoch": 2.7372353673723535, + "grad_norm": 0.8428544998168945, + "learning_rate": 0.00020618315999108454, + "loss": 0.43131070137023925, + "mean_token_accuracy": 0.8701941035687923, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.49888394738352576, + "eval_loss": 0.5459766387939453, + "eval_mean_token_accuracy": 0.8511758872935938, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.2222, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.995, + "step": 1100 + }, + { + "entropy": 0.5212558470666409, + "epoch": 2.7870485678704857, + "grad_norm": 1.129318118095398, + "learning_rate": 0.00020505130397505635, + "loss": 0.44249300956726073, + "mean_token_accuracy": 0.8654101334512234, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5179622324053631, + "eval_loss": 0.5522801280021667, + "eval_mean_token_accuracy": 0.8497019947268242, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.1903, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.996, + "step": 1120 + }, + { + "entropy": 0.4988406613469124, + "epoch": 2.8368617683686175, + "grad_norm": 0.6460545063018799, + "learning_rate": 0.00020389172868146263, + "loss": 0.4386270523071289, + "mean_token_accuracy": 0.8690383620560169, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.5042278484203094, + "eval_loss": 0.5433034300804138, + "eval_mean_token_accuracy": 0.8497674451317898, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.3028, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.993, + "step": 1140 + }, + { + "entropy": 0.4926559619605541, + "epoch": 2.8866749688667497, + "grad_norm": 0.8199329972267151, + "learning_rate": 0.00020270478382239615, + "loss": 0.4313485145568848, + "mean_token_accuracy": 0.8674727231264114, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.503873193160046, + "eval_loss": 0.5388111472129822, + "eval_mean_token_accuracy": 0.8526195034731266, + "eval_num_tokens": 2710196.0, + "eval_runtime": 86.4054, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.991, + "step": 1160 + }, + { + "entropy": 0.5020013231784105, + "epoch": 2.936488169364882, + "grad_norm": 0.7344821095466614, + "learning_rate": 0.00020149082736423723, + "loss": 0.43590536117553713, + "mean_token_accuracy": 0.8671772189438343, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5368241809828337, + "eval_loss": 0.5355703830718994, + "eval_mean_token_accuracy": 0.8517617773871089, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.2945, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1180 + }, + { + "entropy": 0.5112275708466768, + "epoch": 2.9863013698630136, + "grad_norm": 0.6951606869697571, + "learning_rate": 0.00020025022541969622, + "loss": 0.43579301834106443, + "mean_token_accuracy": 0.8641206480562686, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.5066795706055885, + "eval_loss": 0.5415249466896057, + "eval_mean_token_accuracy": 0.8493563373421513, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.5005, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.988, + "step": 1200 + }, + { + "entropy": 0.42298635305502474, + "epoch": 3.0348692403486925, + "grad_norm": 0.8201794028282166, + "learning_rate": 0.00019898335213739863, + "loss": 0.35593905448913576, + "mean_token_accuracy": 0.889238600547497, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.4584170470750609, + "eval_loss": 0.569487452507019, + "eval_mean_token_accuracy": 0.8495814173027526, + "eval_num_tokens": 2848509.0, + "eval_runtime": 86.2281, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 1220 + }, + { + "entropy": 0.37450140453875064, + "epoch": 3.0846824408468243, + "grad_norm": 0.7308394908905029, + "learning_rate": 0.0001976905895890471, + "loss": 0.307823920249939, + "mean_token_accuracy": 0.9001288741827012, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.45185995916294497, + "eval_loss": 0.5672881603240967, + "eval_mean_token_accuracy": 0.8511318519364955, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.0819, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.998, + "step": 1240 + }, + { + "entropy": 0.3887945845723152, + "epoch": 3.1344956413449565, + "grad_norm": 0.7299330830574036, + "learning_rate": 0.0001963723276541939, + "loss": 0.32047903537750244, + "mean_token_accuracy": 0.8960984498262405, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.44865354549053105, + "eval_loss": 0.5666037201881409, + "eval_mean_token_accuracy": 0.8496572649063066, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 1260 + }, + { + "entropy": 0.39677664265036583, + "epoch": 3.1843088418430883, + "grad_norm": 0.9533219933509827, + "learning_rate": 0.00019502896390265838, + "loss": 0.3253983497619629, + "mean_token_accuracy": 0.8964207418262958, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.4641980809527774, + "eval_loss": 0.5814996957778931, + "eval_mean_token_accuracy": 0.8485886212005171, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.7784, + "eval_samples_per_second": 15.845, + "eval_steps_per_second": 1.982, + "step": 1280 + }, + { + "entropy": 0.39210722744464876, + "epoch": 3.2341220423412205, + "grad_norm": 0.7447651028633118, + "learning_rate": 0.00019366090347462545, + "loss": 0.3276803970336914, + "mean_token_accuracy": 0.8930055953562259, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43595615254585135, + "eval_loss": 0.5722188353538513, + "eval_mean_token_accuracy": 0.8501105755567551, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.5271, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 1300 + }, + { + "entropy": 0.3684127271175385, + "epoch": 3.2839352428393527, + "grad_norm": 0.6934201121330261, + "learning_rate": 0.00019226855895846078, + "loss": 0.3156379222869873, + "mean_token_accuracy": 0.8976306475698947, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.4628148723480313, + "eval_loss": 0.5631352066993713, + "eval_mean_token_accuracy": 0.8504934813394103, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.3436, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 1320 + }, + { + "entropy": 0.4073401909321547, + "epoch": 3.3337484433374844, + "grad_norm": 0.9386897683143616, + "learning_rate": 0.00019085235026627994, + "loss": 0.34265310764312745, + "mean_token_accuracy": 0.8902062118053437, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.46455050623694133, + "eval_loss": 0.5586736798286438, + "eval_mean_token_accuracy": 0.8506874702004499, + "eval_num_tokens": 3132874.0, + "eval_runtime": 86.1286, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.997, + "step": 1340 + }, + { + "entropy": 0.4046429242938757, + "epoch": 3.383561643835616, + "grad_norm": 0.9633992314338684, + "learning_rate": 0.00018941270450730836, + "loss": 0.33816893100738527, + "mean_token_accuracy": 0.8927541889250279, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.46846531660750856, + "eval_loss": 0.561501681804657, + "eval_mean_token_accuracy": 0.8496256377114806, + "eval_num_tokens": 3178055.0, + "eval_runtime": 86.685, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1360 + }, + { + "entropy": 0.39872407019138334, + "epoch": 3.4333748443337484, + "grad_norm": 0.7786458730697632, + "learning_rate": 0.00018795005585907113, + "loss": 0.33342490196228025, + "mean_token_accuracy": 0.8944805048406124, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.42709505973860273, + "eval_loss": 0.5751848220825195, + "eval_mean_token_accuracy": 0.8507290447867194, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.6892, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 1380 + }, + { + "entropy": 0.3923338124528527, + "epoch": 3.4831880448318806, + "grad_norm": 0.9305956363677979, + "learning_rate": 0.0001864648454364511, + "loss": 0.33188116550445557, + "mean_token_accuracy": 0.8943330392241478, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.4386174779298694, + "eval_loss": 0.5680831074714661, + "eval_mean_token_accuracy": 0.8513129727784977, + "eval_num_tokens": 3274096.0, + "eval_runtime": 86.2671, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 1400 + }, + { + "entropy": 0.3856233984231949, + "epoch": 3.5330012453300124, + "grad_norm": 1.0362752676010132, + "learning_rate": 0.0001849575211586545, + "loss": 0.33098697662353516, + "mean_token_accuracy": 0.8961390435695649, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4574795474493226, + "eval_loss": 0.5630439519882202, + "eval_mean_token_accuracy": 0.8520988873964133, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.6035, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 1420 + }, + { + "entropy": 0.39812871962785723, + "epoch": 3.5828144458281446, + "grad_norm": 0.7807195782661438, + "learning_rate": 0.0001834285376141247, + "loss": 0.3333771228790283, + "mean_token_accuracy": 0.8930827379226685, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.4556825893909432, + "eval_loss": 0.5689062476158142, + "eval_mean_token_accuracy": 0.8507103507601937, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.1606, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.996, + "step": 1440 + }, + { + "entropy": 0.4147744856774807, + "epoch": 3.6326276463262763, + "grad_norm": 0.6429352164268494, + "learning_rate": 0.00018187835592344443, + "loss": 0.3482560873031616, + "mean_token_accuracy": 0.8910200245678425, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.46600024540757023, + "eval_loss": 0.5609709024429321, + "eval_mean_token_accuracy": 0.8491220876227977, + "eval_num_tokens": 3415600.0, + "eval_runtime": 86.8039, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1460 + }, + { + "entropy": 0.40425071083009245, + "epoch": 3.6824408468244085, + "grad_norm": 0.8613698482513428, + "learning_rate": 0.0001803074436002682, + "loss": 0.342916464805603, + "mean_token_accuracy": 0.8916418336331844, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.43855057899342026, + "eval_loss": 0.5720968246459961, + "eval_mean_token_accuracy": 0.8500823641932288, + "eval_num_tokens": 3460471.0, + "eval_runtime": 86.6746, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1480 + }, + { + "entropy": 0.39465143866837027, + "epoch": 3.7322540473225407, + "grad_norm": 0.6285189986228943, + "learning_rate": 0.0001787162744103265, + "loss": 0.3424591779708862, + "mean_token_accuracy": 0.8906558901071548, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4509461877304454, + "eval_loss": 0.5590082406997681, + "eval_mean_token_accuracy": 0.8511747371318729, + "eval_num_tokens": 3507647.0, + "eval_runtime": 86.8126, + "eval_samples_per_second": 15.839, + "eval_steps_per_second": 1.981, + "step": 1500 + }, + { + "entropy": 0.4021005939692259, + "epoch": 3.7820672478206725, + "grad_norm": 0.8821248412132263, + "learning_rate": 0.00017710532822854468, + "loss": 0.3462103843688965, + "mean_token_accuracy": 0.889109355956316, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.4502199075596277, + "eval_loss": 0.566046416759491, + "eval_mean_token_accuracy": 0.8501714208098345, + "eval_num_tokens": 3548934.0, + "eval_runtime": 86.8336, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.981, + "step": 1520 + }, + { + "entropy": 0.4017397932708263, + "epoch": 3.8318804483188043, + "grad_norm": 0.8400952816009521, + "learning_rate": 0.0001754750908943189, + "loss": 0.34890995025634763, + "mean_token_accuracy": 0.8892098367214203, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.4614003023435903, + "eval_loss": 0.5617933869361877, + "eval_mean_token_accuracy": 0.8515863616106122, + "eval_num_tokens": 3597186.0, + "eval_runtime": 86.4609, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 1540 + }, + { + "entropy": 0.4112051840871572, + "epoch": 3.8816936488169365, + "grad_norm": 0.769478440284729, + "learning_rate": 0.0001738260540649939, + "loss": 0.34711437225341796, + "mean_token_accuracy": 0.8911717928946018, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4540443811998811, + "eval_loss": 0.5576469898223877, + "eval_mean_token_accuracy": 0.8512079674144124, + "eval_num_tokens": 3646646.0, + "eval_runtime": 86.5103, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 1560 + }, + { + "entropy": 0.41105241514742374, + "epoch": 3.9315068493150687, + "grad_norm": 0.8468427062034607, + "learning_rate": 0.00017215871506758568, + "loss": 0.3433023452758789, + "mean_token_accuracy": 0.8898739732801915, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.4707539707075718, + "eval_loss": 0.5641466379165649, + "eval_mean_token_accuracy": 0.8495440957851188, + "eval_num_tokens": 3689560.0, + "eval_runtime": 86.609, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.986, + "step": 1580 + }, + { + "entropy": 0.41016379147768023, + "epoch": 3.9813200498132004, + "grad_norm": 0.7482675313949585, + "learning_rate": 0.0001704735767487946, + "loss": 0.34550890922546384, + "mean_token_accuracy": 0.8893028847873211, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.46391099864660307, + "eval_loss": 0.5593640804290771, + "eval_mean_token_accuracy": 0.8510130581467651, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.3975, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 1600 + }, + { + "entropy": 0.33167599791135544, + "epoch": 4.029887920298879, + "grad_norm": 0.9435692429542542, + "learning_rate": 0.00016877114732335337, + "loss": 0.2716026544570923, + "mean_token_accuracy": 0.9133149828666296, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.38499350005457567, + "eval_loss": 0.6298249363899231, + "eval_mean_token_accuracy": 0.8488117071778275, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.2933, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1620 + }, + { + "entropy": 0.3000166634097695, + "epoch": 4.0797011207970115, + "grad_norm": 0.8080845475196838, + "learning_rate": 0.0001670519402207569, + "loss": 0.22617182731628419, + "mean_token_accuracy": 0.9253474645316601, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.370110988703578, + "eval_loss": 0.6338461637496948, + "eval_mean_token_accuracy": 0.8485634801692741, + "eval_num_tokens": 3828830.0, + "eval_runtime": 85.9508, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.001, + "step": 1640 + }, + { + "entropy": 0.2986910421401262, + "epoch": 4.129514321295143, + "grad_norm": 0.7310900092124939, + "learning_rate": 0.0001653164739304185, + "loss": 0.22367463111877442, + "mean_token_accuracy": 0.9252275295555592, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.3944379702037157, + "eval_loss": 0.6109381914138794, + "eval_mean_token_accuracy": 0.849291454220927, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.6728, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1660 + }, + { + "entropy": 0.3095553796738386, + "epoch": 4.179327521793275, + "grad_norm": 0.7059140801429749, + "learning_rate": 0.0001635652718453007, + "loss": 0.23651680946350098, + "mean_token_accuracy": 0.9208931416273117, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.3910588648949945, + "eval_loss": 0.6104469299316406, + "eval_mean_token_accuracy": 0.8486883893262508, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7612, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.982, + "step": 1680 + }, + { + "entropy": 0.3001101028174162, + "epoch": 4.229140722291407, + "grad_norm": 0.6787802577018738, + "learning_rate": 0.00016179886210406728, + "loss": 0.23130471706390382, + "mean_token_accuracy": 0.9233332790434361, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3794369170832079, + "eval_loss": 0.6182110905647278, + "eval_mean_token_accuracy": 0.8495433777570724, + "eval_num_tokens": 3967474.0, + "eval_runtime": 85.94, + "eval_samples_per_second": 16.0, + "eval_steps_per_second": 2.001, + "step": 1700 + }, + { + "entropy": 0.3031421799212694, + "epoch": 4.2789539227895395, + "grad_norm": 0.9732038378715515, + "learning_rate": 0.0001600177774318036, + "loss": 0.2359529733657837, + "mean_token_accuracy": 0.9217648565769195, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3923123094231583, + "eval_loss": 0.6057384610176086, + "eval_mean_token_accuracy": 0.8508818288182103, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7647, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.29365369994193313, + "epoch": 4.328767123287671, + "grad_norm": 0.7681498527526855, + "learning_rate": 0.0001582225549793541, + "loss": 0.2269371747970581, + "mean_token_accuracy": 0.9245341829955578, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.4011661055129628, + "eval_loss": 0.6144486665725708, + "eval_mean_token_accuracy": 0.8480324357054955, + "eval_num_tokens": 4062594.0, + "eval_runtime": 87.1306, + "eval_samples_per_second": 15.781, + "eval_steps_per_second": 1.974, + "step": 1740 + }, + { + "entropy": 0.29396994728595016, + "epoch": 4.378580323785803, + "grad_norm": 1.0001007318496704, + "learning_rate": 0.0001564137361613248, + "loss": 0.22777395248413085, + "mean_token_accuracy": 0.9262309700250626, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38518730195802314, + "eval_loss": 0.6202630400657654, + "eval_mean_token_accuracy": 0.8493869807137999, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6616, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.3096018506214023, + "epoch": 4.428393524283935, + "grad_norm": 1.0448365211486816, + "learning_rate": 0.00015459186649280024, + "loss": 0.23696351051330566, + "mean_token_accuracy": 0.9217322513461113, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.3946371126140273, + "eval_loss": 0.6079026460647583, + "eval_mean_token_accuracy": 0.8492515852978063, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6582, + "eval_samples_per_second": 15.867, + "eval_steps_per_second": 1.985, + "step": 1780 + }, + { + "entropy": 0.32619857545942066, + "epoch": 4.478206724782067, + "grad_norm": 0.7210651636123657, + "learning_rate": 0.00015275749542482337, + "loss": 0.24651215076446534, + "mean_token_accuracy": 0.9177676141262054, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.3947690814560236, + "eval_loss": 0.6065912246704102, + "eval_mean_token_accuracy": 0.8502957744653835, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.5959, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.986, + "step": 1800 + }, + { + "entropy": 0.3193941755220294, + "epoch": 4.5280199252802, + "grad_norm": 0.8281906843185425, + "learning_rate": 0.0001509111761786888, + "loss": 0.23936262130737304, + "mean_token_accuracy": 0.9201708927750587, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38704028864239537, + "eval_loss": 0.6006569266319275, + "eval_mean_token_accuracy": 0.8502406720505205, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.8059, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1820 + }, + { + "entropy": 0.3164879363030195, + "epoch": 4.577833125778331, + "grad_norm": 0.7892968654632568, + "learning_rate": 0.00014905346557909867, + "loss": 0.24541733264923096, + "mean_token_accuracy": 0.9175932116806507, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.38861122120951497, + "eval_loss": 0.6115967631340027, + "eval_mean_token_accuracy": 0.849471275196519, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.2946, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1840 + }, + { + "entropy": 0.3051785985007882, + "epoch": 4.627646326276463, + "grad_norm": 0.8109654188156128, + "learning_rate": 0.0001471849238862319, + "loss": 0.23433220386505127, + "mean_token_accuracy": 0.9206570319831371, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.37162452295076015, + "eval_loss": 0.6184061765670776, + "eval_mean_token_accuracy": 0.8501173268223918, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.6865, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1860 + }, + { + "entropy": 0.3168198253959417, + "epoch": 4.677459526774595, + "grad_norm": 0.9512342214584351, + "learning_rate": 0.0001453061146267775, + "loss": 0.23832404613494873, + "mean_token_accuracy": 0.9197044663131237, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3845940856912801, + "eval_loss": 0.606762707233429, + "eval_mean_token_accuracy": 0.8504838194957999, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.5175, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 1880 + }, + { + "entropy": 0.30791807882487776, + "epoch": 4.7272727272727275, + "grad_norm": 0.8123113512992859, + "learning_rate": 0.00014341760442398248, + "loss": 0.2395785331726074, + "mean_token_accuracy": 0.918928150832653, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.39762327222283494, + "eval_loss": 0.5994202494621277, + "eval_mean_token_accuracy": 0.8509274201337681, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.2873, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.993, + "step": 1900 + }, + { + "entropy": 0.3021434534341097, + "epoch": 4.777085927770859, + "grad_norm": 0.731787383556366, + "learning_rate": 0.000141519962826766, + "loss": 0.23494718074798585, + "mean_token_accuracy": 0.9201403826475143, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.3827026732439219, + "eval_loss": 0.5995895862579346, + "eval_mean_token_accuracy": 0.851468373523202, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.3006, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 1920 + }, + { + "entropy": 0.31626159623265265, + "epoch": 4.826899128268991, + "grad_norm": 0.8848487138748169, + "learning_rate": 0.00013961376213795132, + "loss": 0.2439030647277832, + "mean_token_accuracy": 0.9196575872600079, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.388698436839636, + "eval_loss": 0.6000174283981323, + "eval_mean_token_accuracy": 0.8518068187458571, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.8979, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.979, + "step": 1940 + }, + { + "entropy": 0.30520407035946845, + "epoch": 4.876712328767123, + "grad_norm": 0.8532460927963257, + "learning_rate": 0.00013769957724166695, + "loss": 0.23458616733551024, + "mean_token_accuracy": 0.9221912942826748, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.38777847102908203, + "eval_loss": 0.6004981398582458, + "eval_mean_token_accuracy": 0.8516481768253238, + "eval_num_tokens": 4578167.0, + "eval_runtime": 87.0777, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.975, + "step": 1960 + }, + { + "entropy": 0.3226448342204094, + "epoch": 4.926525529265255, + "grad_norm": 0.6945561766624451, + "learning_rate": 0.0001357779854299694, + "loss": 0.24048397541046143, + "mean_token_accuracy": 0.9195300146937371, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.38581624263247777, + "eval_loss": 0.6029234528541565, + "eval_mean_token_accuracy": 0.8514213260523108, + "eval_num_tokens": 4622316.0, + "eval_runtime": 85.8729, + "eval_samples_per_second": 16.012, + "eval_steps_per_second": 2.003, + "step": 1980 + }, + { + "entropy": 0.3051655298098922, + "epoch": 4.976338729763388, + "grad_norm": 0.7976452708244324, + "learning_rate": 0.00013384956622874001, + "loss": 0.23584742546081544, + "mean_token_accuracy": 0.9216851457953453, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.37913159246361533, + "eval_loss": 0.6057604551315308, + "eval_mean_token_accuracy": 0.8525801203971686, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.1145, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 2000 + }, + { + "entropy": 0.27438195240803254, + "epoch": 5.024906600249066, + "grad_norm": 0.6729586124420166, + "learning_rate": 0.0001319149012229075, + "loss": 0.19775952100753785, + "mean_token_accuracy": 0.9339428559327737, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.3448961910813354, + "eval_loss": 0.6750120520591736, + "eval_mean_token_accuracy": 0.8487970232963562, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.1169, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 2020 + }, + { + "entropy": 0.21423916313797237, + "epoch": 5.074719800747198, + "grad_norm": 0.6934391856193542, + "learning_rate": 0.00012997457388105022, + "loss": 0.1439570426940918, + "mean_token_accuracy": 0.9528236843645572, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.3570949243771475, + "eval_loss": 0.6465504169464111, + "eval_mean_token_accuracy": 0.8490785547467166, + "eval_num_tokens": 4763269.0, + "eval_runtime": 85.9574, + "eval_samples_per_second": 15.996, + "eval_steps_per_second": 2.001, + "step": 2040 + }, + { + "entropy": 0.20838565267622472, + "epoch": 5.12453300124533, + "grad_norm": 0.7286986112594604, + "learning_rate": 0.00012802916937942972, + "loss": 0.14467307329177856, + "mean_token_accuracy": 0.950994835793972, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.3452463157821533, + "eval_loss": 0.6705958843231201, + "eval_mean_token_accuracy": 0.8490352796953778, + "eval_num_tokens": 4809047.0, + "eval_runtime": 86.228, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 2060 + }, + { + "entropy": 0.20453082229942082, + "epoch": 5.174346201743462, + "grad_norm": 0.7515555620193481, + "learning_rate": 0.00012607927442550974, + "loss": 0.13732000589370727, + "mean_token_accuracy": 0.9537357829511166, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.32431264914745506, + "eval_loss": 0.6743043065071106, + "eval_mean_token_accuracy": 0.8504878629085629, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.5948, + "eval_samples_per_second": 15.879, + "eval_steps_per_second": 1.986, + "step": 2080 + }, + { + "entropy": 0.21812320686876774, + "epoch": 5.224159402241594, + "grad_norm": 0.9093465209007263, + "learning_rate": 0.0001241254770810132, + "loss": 0.14311420917510986, + "mean_token_accuracy": 0.9514068141579628, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.33086285835435225, + "eval_loss": 0.6676449179649353, + "eval_mean_token_accuracy": 0.8505287662495015, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 2100 + }, + { + "entropy": 0.2180163251236081, + "epoch": 5.273972602739726, + "grad_norm": 0.6703007221221924, + "learning_rate": 0.00012216836658457075, + "loss": 0.14803968667984008, + "mean_token_accuracy": 0.9521303348243236, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.33162341708707255, + "eval_loss": 0.6658875942230225, + "eval_mean_token_accuracy": 0.8500757605530495, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.6296, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 2120 + }, + { + "entropy": 0.22511130161583423, + "epoch": 5.323785803237858, + "grad_norm": 0.8078880906105042, + "learning_rate": 0.00012020853317401455, + "loss": 0.15228408575057983, + "mean_token_accuracy": 0.947144789993763, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3354601170434508, + "eval_loss": 0.6677829623222351, + "eval_mean_token_accuracy": 0.8482600024273229, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.4689, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.989, + "step": 2140 + }, + { + "entropy": 0.2244176059961319, + "epoch": 5.37359900373599, + "grad_norm": 0.9636075496673584, + "learning_rate": 0.00011824656790837037, + "loss": 0.15260883569717407, + "mean_token_accuracy": 0.9471467643976211, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.3381616926297199, + "eval_loss": 0.6694412231445312, + "eval_mean_token_accuracy": 0.8482369603805764, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.4147, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 2160 + }, + { + "entropy": 0.22982364390045404, + "epoch": 5.423412204234122, + "grad_norm": 0.775401771068573, + "learning_rate": 0.00011628306248960262, + "loss": 0.15140302181243898, + "mean_token_accuracy": 0.9492553934454918, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.3305150235808173, + "eval_loss": 0.6717822551727295, + "eval_mean_token_accuracy": 0.8489849723355715, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.4728, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.989, + "step": 2180 + }, + { + "entropy": 0.21448935717344284, + "epoch": 5.473225404732254, + "grad_norm": 0.6575281023979187, + "learning_rate": 0.00011431860908416465, + "loss": 0.1452319622039795, + "mean_token_accuracy": 0.9505287684500218, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3488145174328671, + "eval_loss": 0.6612305641174316, + "eval_mean_token_accuracy": 0.8492907808963642, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6927, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 2200 + }, + { + "entropy": 0.23091202937066554, + "epoch": 5.523038605230386, + "grad_norm": 0.8909686207771301, + "learning_rate": 0.00011235380014440985, + "loss": 0.15150139331817628, + "mean_token_accuracy": 0.9497875183820724, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.3268539015810157, + "eval_loss": 0.6667542457580566, + "eval_mean_token_accuracy": 0.8499062903398691, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.4644, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 2220 + }, + { + "entropy": 0.2227974807843566, + "epoch": 5.572851805728518, + "grad_norm": 0.6180275082588196, + "learning_rate": 0.0001103892282299158, + "loss": 0.1491069197654724, + "mean_token_accuracy": 0.9488144010305405, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3346347655494546, + "eval_loss": 0.6665948629379272, + "eval_mean_token_accuracy": 0.8499961893918903, + "eval_num_tokens": 5226864.0, + "eval_runtime": 87.0548, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.976, + "step": 2240 + }, + { + "entropy": 0.21368421968072654, + "epoch": 5.62266500622665, + "grad_norm": 0.6004369258880615, + "learning_rate": 0.00010842548582877651, + "loss": 0.14485255479812623, + "mean_token_accuracy": 0.9502056457102299, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.32753298804163933, + "eval_loss": 0.6680151224136353, + "eval_mean_token_accuracy": 0.8515451086121936, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.8524, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.98, + "step": 2260 + }, + { + "entropy": 0.2103635374456644, + "epoch": 5.672478206724782, + "grad_norm": 0.699174702167511, + "learning_rate": 0.00010646316517891613, + "loss": 0.14297772645950318, + "mean_token_accuracy": 0.9512537539005279, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.32966585959806, + "eval_loss": 0.675578773021698, + "eval_mean_token_accuracy": 0.8509623023659684, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.4518, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.99, + "step": 2280 + }, + { + "entropy": 0.22516900151968003, + "epoch": 5.722291407222914, + "grad_norm": 0.6637354493141174, + "learning_rate": 0.00010450285808947797, + "loss": 0.15202572345733642, + "mean_token_accuracy": 0.9482452072203159, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3369456917740578, + "eval_loss": 0.6697061061859131, + "eval_mean_token_accuracy": 0.848603522361711, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.6371, + "eval_samples_per_second": 15.871, + "eval_steps_per_second": 1.985, + "step": 2300 + }, + { + "entropy": 0.21841065725311637, + "epoch": 5.772104607721046, + "grad_norm": 0.7940268516540527, + "learning_rate": 0.00010254515576234297, + "loss": 0.14710167646408082, + "mean_token_accuracy": 0.9493498183786869, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3237486180177955, + "eval_loss": 0.6779657602310181, + "eval_mean_token_accuracy": 0.8500715313955794, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.1826, + "eval_samples_per_second": 15.954, + "eval_steps_per_second": 1.996, + "step": 2320 + }, + { + "entropy": 0.22146204356104135, + "epoch": 5.821917808219178, + "grad_norm": 0.9234833121299744, + "learning_rate": 0.00010059064861383132, + "loss": 0.14720046520233154, + "mean_token_accuracy": 0.9493872679769992, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.32365207564692167, + "eval_loss": 0.6704005002975464, + "eval_mean_token_accuracy": 0.8507985760306203, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.5494, + "eval_samples_per_second": 15.887, + "eval_steps_per_second": 1.987, + "step": 2340 + }, + { + "entropy": 0.20934011954814197, + "epoch": 5.87173100871731, + "grad_norm": 0.5547503232955933, + "learning_rate": 9.863992609664084e-05, + "loss": 0.1464867353439331, + "mean_token_accuracy": 0.9503875687718392, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.3330401429083458, + "eval_loss": 0.6659091114997864, + "eval_mean_token_accuracy": 0.8504848906467127, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.5855, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 2360 + }, + { + "entropy": 0.21678635366261007, + "epoch": 5.921544209215442, + "grad_norm": 0.570612907409668, + "learning_rate": 9.669357652207635e-05, + "loss": 0.14821385145187377, + "mean_token_accuracy": 0.9503940217196941, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3322022325077722, + "eval_loss": 0.6722489595413208, + "eval_mean_token_accuracy": 0.8489979422369669, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.2986, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 2380 + }, + { + "entropy": 0.20932920072227718, + "epoch": 5.971357409713574, + "grad_norm": 0.7879557609558105, + "learning_rate": 9.475218688262262e-05, + "loss": 0.14675841331481934, + "mean_token_accuracy": 0.9507176131010056, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.3199348642902319, + "eval_loss": 0.6698136329650879, + "eval_mean_token_accuracy": 0.8514142130003419, + "eval_num_tokens": 5605400.0, + "eval_runtime": 85.8995, + "eval_samples_per_second": 16.007, + "eval_steps_per_second": 2.002, + "step": 2400 + }, + { + "entropy": 0.21032143919131693, + "epoch": 6.019925280199253, + "grad_norm": 0.5823076367378235, + "learning_rate": 9.281634267491569e-05, + "loss": 0.13322267532348633, + "mean_token_accuracy": 0.9550939072401096, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.30206270117399303, + "eval_loss": 0.7093168497085571, + "eval_mean_token_accuracy": 0.8500627639681794, + "eval_num_tokens": 5648968.0, + "eval_runtime": 85.8128, + "eval_samples_per_second": 16.023, + "eval_steps_per_second": 2.004, + "step": 2420 + }, + { + "entropy": 0.1534628233872354, + "epoch": 6.069738480697385, + "grad_norm": 0.710133969783783, + "learning_rate": 9.088662772316508e-05, + "loss": 0.09078952670097351, + "mean_token_accuracy": 0.9678447999060154, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.28208133101809857, + "eval_loss": 0.7636417150497437, + "eval_mean_token_accuracy": 0.8494061477655588, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9724, + "eval_samples_per_second": 15.994, + "eval_steps_per_second": 2.001, + "step": 2440 + }, + { + "entropy": 0.16151462448760867, + "epoch": 6.119551681195516, + "grad_norm": 0.5793812274932861, + "learning_rate": 8.896362400308028e-05, + "loss": 0.09545697569847107, + "mean_token_accuracy": 0.9671573750674725, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.2833245605403601, + "eval_loss": 0.7402405738830566, + "eval_mean_token_accuracy": 0.8503523728875226, + "eval_num_tokens": 5745090.0, + "eval_runtime": 85.5461, + "eval_samples_per_second": 16.073, + "eval_steps_per_second": 2.011, + "step": 2460 + }, + { + "entropy": 0.15203177919611335, + "epoch": 6.169364881693649, + "grad_norm": 0.4251123368740082, + "learning_rate": 8.704791146635483e-05, + "loss": 0.09420782327651978, + "mean_token_accuracy": 0.9677386932075024, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.28572545962971313, + "eval_loss": 0.735416829586029, + "eval_mean_token_accuracy": 0.8487084663884584, + "eval_num_tokens": 5790333.0, + "eval_runtime": 85.4801, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.012, + "step": 2480 + }, + { + "entropy": 0.15587336672469973, + "epoch": 6.219178082191781, + "grad_norm": 0.4357028007507324, + "learning_rate": 8.514006786576085e-05, + "loss": 0.09429320096969604, + "mean_token_accuracy": 0.9682952925562859, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.2859006894882335, + "eval_loss": 0.7347224950790405, + "eval_mean_token_accuracy": 0.8501905518215757, + "eval_num_tokens": 5837321.0, + "eval_runtime": 85.7578, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.006, + "step": 2500 + }, + { + "entropy": 0.15765639198943973, + "epoch": 6.268991282689913, + "grad_norm": 0.47331130504608154, + "learning_rate": 8.324066858090663e-05, + "loss": 0.09571113586425781, + "mean_token_accuracy": 0.9683481335639954, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.29231513846059176, + "eval_loss": 0.7392512559890747, + "eval_mean_token_accuracy": 0.8486633983462356, + "eval_num_tokens": 5884398.0, + "eval_runtime": 85.7846, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.005, + "step": 2520 + }, + { + "entropy": 0.16176860257983208, + "epoch": 6.318804483188045, + "grad_norm": 0.6142018437385559, + "learning_rate": 8.135028644470992e-05, + "loss": 0.09486144185066223, + "mean_token_accuracy": 0.9682316601276397, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.2851274753379267, + "eval_loss": 0.7520816922187805, + "eval_mean_token_accuracy": 0.8501113649717597, + "eval_num_tokens": 5929876.0, + "eval_runtime": 85.9425, + "eval_samples_per_second": 15.999, + "eval_steps_per_second": 2.001, + "step": 2540 + }, + { + "entropy": 0.15404034564271568, + "epoch": 6.3686176836861765, + "grad_norm": 0.6051287651062012, + "learning_rate": 7.946949157063964e-05, + "loss": 0.09280472993850708, + "mean_token_accuracy": 0.9684635892510414, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28802703563557114, + "eval_loss": 0.7439162135124207, + "eval_mean_token_accuracy": 0.8499851770872293, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.0703, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.998, + "step": 2560 + }, + { + "entropy": 0.15343588953837753, + "epoch": 6.418430884184309, + "grad_norm": 0.4823743402957916, + "learning_rate": 7.759885118077701e-05, + "loss": 0.09000591039657593, + "mean_token_accuracy": 0.9699928767979145, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2795634938533916, + "eval_loss": 0.7647850513458252, + "eval_mean_token_accuracy": 0.8503464397995971, + "eval_num_tokens": 6025380.0, + "eval_runtime": 85.8886, + "eval_samples_per_second": 16.009, + "eval_steps_per_second": 2.003, + "step": 2580 + }, + { + "entropy": 0.15740026142448188, + "epoch": 6.468244084682441, + "grad_norm": 0.5082696676254272, + "learning_rate": 7.57389294347494e-05, + "loss": 0.09191849827766418, + "mean_token_accuracy": 0.9692809768021107, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2913342311458532, + "eval_loss": 0.7518694996833801, + "eval_mean_token_accuracy": 0.8483168302580367, + "eval_num_tokens": 6073349.0, + "eval_runtime": 85.5761, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.01, + "step": 2600 + }, + { + "entropy": 0.15922069251537324, + "epoch": 6.518057285180573, + "grad_norm": 0.3995199501514435, + "learning_rate": 7.389028725958736e-05, + "loss": 0.09584367871284485, + "mean_token_accuracy": 0.9685114495456218, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.2863075934177221, + "eval_loss": 0.7539381384849548, + "eval_mean_token_accuracy": 0.8507507083027862, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.112, + "eval_samples_per_second": 15.968, + "eval_steps_per_second": 1.997, + "step": 2620 + }, + { + "entropy": 0.16197575423866512, + "epoch": 6.567870485678705, + "grad_norm": 0.534295380115509, + "learning_rate": 7.205348218055678e-05, + "loss": 0.0961170256137848, + "mean_token_accuracy": 0.9674530044198036, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.29021967315050057, + "eval_loss": 0.751198947429657, + "eval_mean_token_accuracy": 0.8509796344956686, + "eval_num_tokens": 6165523.0, + "eval_runtime": 85.7958, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.005, + "step": 2640 + }, + { + "entropy": 0.15261746793985367, + "epoch": 6.617683686176837, + "grad_norm": 0.5391237139701843, + "learning_rate": 7.022906815301673e-05, + "loss": 0.0926026999950409, + "mean_token_accuracy": 0.9695659473538398, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.29128045216202736, + "eval_loss": 0.7450292110443115, + "eval_mean_token_accuracy": 0.8498771443616512, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.3963, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 2660 + }, + { + "entropy": 0.16164180357009172, + "epoch": 6.667496886674969, + "grad_norm": 0.5767946243286133, + "learning_rate": 6.841759539535419e-05, + "loss": 0.09291981458663941, + "mean_token_accuracy": 0.9687136687338352, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2897637223088464, + "eval_loss": 0.7503410577774048, + "eval_mean_token_accuracy": 0.8503315164599308, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.0653, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.998, + "step": 2680 + }, + { + "entropy": 0.17062523355707526, + "epoch": 6.717310087173101, + "grad_norm": 0.4974168539047241, + "learning_rate": 6.661961022304563e-05, + "loss": 0.09713236689567566, + "mean_token_accuracy": 0.9661971725523472, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2765843396963075, + "eval_loss": 0.7604002356529236, + "eval_mean_token_accuracy": 0.8521115277395692, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.1676, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 2700 + }, + { + "entropy": 0.17544092936441302, + "epoch": 6.767123287671232, + "grad_norm": 0.5523537993431091, + "learning_rate": 6.483565488389582e-05, + "loss": 0.09709116220474243, + "mean_token_accuracy": 0.9650957375764847, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.27939334659035814, + "eval_loss": 0.7534670829772949, + "eval_mean_token_accuracy": 0.851230604010959, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.2913, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 2720 + }, + { + "entropy": 0.15991022661328316, + "epoch": 6.816936488169365, + "grad_norm": 0.478551983833313, + "learning_rate": 6.306626739450311e-05, + "loss": 0.09564646482467651, + "mean_token_accuracy": 0.9679084822535515, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.27878295491601146, + "eval_loss": 0.7519959211349487, + "eval_mean_token_accuracy": 0.8510654949864676, + "eval_num_tokens": 6397720.0, + "eval_runtime": 85.9109, + "eval_samples_per_second": 16.005, + "eval_steps_per_second": 2.002, + "step": 2740 + }, + { + "entropy": 0.16824879590421915, + "epoch": 6.866749688667497, + "grad_norm": 0.6681098937988281, + "learning_rate": 6.131198137800108e-05, + "loss": 0.0962279736995697, + "mean_token_accuracy": 0.966830012947321, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.2834690434121808, + "eval_loss": 0.751922070980072, + "eval_mean_token_accuracy": 0.8521237577809844, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.3618, + "eval_samples_per_second": 15.921, + "eval_steps_per_second": 1.992, + "step": 2760 + }, + { + "entropy": 0.1518704930320382, + "epoch": 6.916562889165629, + "grad_norm": 0.5201290249824524, + "learning_rate": 5.957332590312513e-05, + "loss": 0.09010660648345947, + "mean_token_accuracy": 0.9693463340401649, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.28485129617674404, + "eval_loss": 0.7452457547187805, + "eval_mean_token_accuracy": 0.8512036796919135, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.4524, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.99, + "step": 2780 + }, + { + "entropy": 0.15512610590085388, + "epoch": 6.966376089663761, + "grad_norm": 0.42802050709724426, + "learning_rate": 5.785082532465233e-05, + "loss": 0.09320432543754578, + "mean_token_accuracy": 0.9686134628951549, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.27554594526110693, + "eval_loss": 0.7644653916358948, + "eval_mean_token_accuracy": 0.8513738523389018, + "eval_num_tokens": 6540175.0, + "eval_runtime": 85.7609, + "eval_samples_per_second": 16.033, + "eval_steps_per_second": 2.006, + "step": 2800 + }, + { + "entropy": 0.17524497526196334, + "epoch": 7.01494396014944, + "grad_norm": 0.3330269157886505, + "learning_rate": 5.6144999125263545e-05, + "loss": 0.0895616888999939, + "mean_token_accuracy": 0.9682766932707566, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.2735865569218647, + "eval_loss": 0.768479585647583, + "eval_mean_token_accuracy": 0.8503459383581959, + "eval_num_tokens": 6583767.0, + "eval_runtime": 85.7162, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.007, + "step": 2820 + }, + { + "entropy": 0.1403565663844347, + "epoch": 7.064757160647572, + "grad_norm": 0.35613498091697693, + "learning_rate": 5.4456361758874235e-05, + "loss": 0.07551313638687134, + "mean_token_accuracy": 0.9739301167428493, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.25941789089593775, + "eval_loss": 0.8209511637687683, + "eval_mean_token_accuracy": 0.8505055855873019, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.0943, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 2840 + }, + { + "entropy": 0.13500106502324344, + "epoch": 7.114570361145703, + "grad_norm": 0.34418627619743347, + "learning_rate": 5.2785422495482234e-05, + "loss": 0.07293946146965027, + "mean_token_accuracy": 0.9747208289802074, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.26482899772912954, + "eval_loss": 0.798904538154602, + "eval_mean_token_accuracy": 0.8511530233677044, + "eval_num_tokens": 6672946.0, + "eval_runtime": 85.7915, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.005, + "step": 2860 + }, + { + "entropy": 0.13127502552233636, + "epoch": 7.164383561643835, + "grad_norm": 0.4638441503047943, + "learning_rate": 5.113268526757892e-05, + "loss": 0.07121461629867554, + "mean_token_accuracy": 0.9756786689162255, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2645381211714689, + "eval_loss": 0.809101939201355, + "eval_mean_token_accuracy": 0.8514727898115335, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.84, + "eval_samples_per_second": 16.018, + "eval_steps_per_second": 2.004, + "step": 2880 + }, + { + "entropy": 0.1331390908919275, + "epoch": 7.214196762141968, + "grad_norm": 0.40206775069236755, + "learning_rate": 4.949864851817007e-05, + "loss": 0.07188264131546021, + "mean_token_accuracy": 0.9755406074225903, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.26244733283339544, + "eval_loss": 0.8143188953399658, + "eval_mean_token_accuracy": 0.8514358189909957, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.8546, + "eval_samples_per_second": 16.015, + "eval_steps_per_second": 2.003, + "step": 2900 + }, + { + "entropy": 0.13647331558167936, + "epoch": 7.2640099626401, + "grad_norm": 0.26405787467956543, + "learning_rate": 4.788380505045224e-05, + "loss": 0.07412450313568116, + "mean_token_accuracy": 0.9744274213910102, + "num_tokens": 6809678.0, + "step": 2920 + }, + { + "epoch": 7.2640099626401, + "eval_entropy": 0.2626111418182074, + "eval_loss": 0.8111525177955627, + "eval_mean_token_accuracy": 0.8512121695418691, + "eval_num_tokens": 6809678.0, + "eval_runtime": 85.9626, + "eval_samples_per_second": 15.995, + "eval_steps_per_second": 2.001, + "step": 2920 + }, + { + "entropy": 0.12644002586603165, + "epoch": 7.313823163138232, + "grad_norm": 0.27514681220054626, + "learning_rate": 4.6288641879189884e-05, + "loss": 0.06807711124420165, + "mean_token_accuracy": 0.9760703906416893, + "num_tokens": 6860750.0, + "step": 2940 + }, + { + "epoch": 7.313823163138232, + "eval_entropy": 0.26096762734097106, + "eval_loss": 0.8184595108032227, + "eval_mean_token_accuracy": 0.8501476153384807, + "eval_num_tokens": 6860750.0, + "eval_runtime": 85.9521, + "eval_samples_per_second": 15.997, + "eval_steps_per_second": 2.001, + "step": 2940 + }, + { + "entropy": 0.13920630998909472, + "epoch": 7.363636363636363, + "grad_norm": 0.23584705591201782, + "learning_rate": 4.4713640083838604e-05, + "loss": 0.07301607131958007, + "mean_token_accuracy": 0.9745715200901032, + "num_tokens": 6907092.0, + "step": 2960 + }, + { + "epoch": 7.363636363636363, + "eval_entropy": 0.2612536767021168, + "eval_loss": 0.8116245269775391, + "eval_mean_token_accuracy": 0.8510967350976412, + "eval_num_tokens": 6907092.0, + "eval_runtime": 85.6373, + "eval_samples_per_second": 16.056, + "eval_steps_per_second": 2.008, + "step": 2960 + }, + { + "entropy": 0.1349492883309722, + "epoch": 7.4134495641344955, + "grad_norm": 0.24552719295024872, + "learning_rate": 4.315927466345791e-05, + "loss": 0.07397544980049134, + "mean_token_accuracy": 0.9745095103979111, + "num_tokens": 6952700.0, + "step": 2980 + }, + { + "epoch": 7.4134495641344955, + "eval_entropy": 0.25796533306670744, + "eval_loss": 0.8266491293907166, + "eval_mean_token_accuracy": 0.8511653857868772, + "eval_num_tokens": 6952700.0, + "eval_runtime": 85.7462, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.006, + "step": 2980 + }, + { + "entropy": 0.14479175000451505, + "epoch": 7.463262764632628, + "grad_norm": 0.2846072018146515, + "learning_rate": 4.162601439345814e-05, + "loss": 0.07544798254966736, + "mean_token_accuracy": 0.9727819666266442, + "num_tokens": 6996430.0, + "step": 3000 + }, + { + "epoch": 7.463262764632628, + "eval_entropy": 0.2584348309698493, + "eval_loss": 0.8253348469734192, + "eval_mean_token_accuracy": 0.8511569815319638, + "eval_num_tokens": 6996430.0, + "eval_runtime": 86.2984, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 3000 + }, + { + "entropy": 0.14114196319133043, + "epoch": 7.51307596513076, + "grad_norm": 0.407966285943985, + "learning_rate": 4.011432168422419e-05, + "loss": 0.0736398994922638, + "mean_token_accuracy": 0.9741654269397259, + "num_tokens": 7042038.0, + "step": 3020 + }, + { + "epoch": 7.51307596513076, + "eval_entropy": 0.25232676260693127, + "eval_loss": 0.8296052813529968, + "eval_mean_token_accuracy": 0.8523298349491385, + "eval_num_tokens": 7042038.0, + "eval_runtime": 85.8445, + "eval_samples_per_second": 16.017, + "eval_steps_per_second": 2.004, + "step": 3020 + }, + { + "entropy": 0.1353456223383546, + "epoch": 7.562889165628892, + "grad_norm": 0.2712634801864624, + "learning_rate": 3.8624652441658684e-05, + "loss": 0.07362412214279175, + "mean_token_accuracy": 0.9747945807874203, + "num_tokens": 7089390.0, + "step": 3040 + }, + { + "epoch": 7.562889165628892, + "eval_entropy": 0.2579477243991785, + "eval_loss": 0.8274564743041992, + "eval_mean_token_accuracy": 0.8517705212498821, + "eval_num_tokens": 7089390.0, + "eval_runtime": 85.8222, + "eval_samples_per_second": 16.022, + "eval_steps_per_second": 2.004, + "step": 3040 + }, + { + "entropy": 0.1296080862637609, + "epoch": 7.6127023661270234, + "grad_norm": 0.2371893972158432, + "learning_rate": 3.715745592968707e-05, + "loss": 0.06971035599708557, + "mean_token_accuracy": 0.9759043246507645, + "num_tokens": 7138002.0, + "step": 3060 + }, + { + "epoch": 7.6127023661270234, + "eval_entropy": 0.25391967083479083, + "eval_loss": 0.8197130560874939, + "eval_mean_token_accuracy": 0.8522267875283264, + "eval_num_tokens": 7138002.0, + "eval_runtime": 85.8796, + "eval_samples_per_second": 16.011, + "eval_steps_per_second": 2.003, + "step": 3060 + }, + { + "entropy": 0.1311203008517623, + "epoch": 7.662515566625156, + "grad_norm": 0.22499267756938934, + "learning_rate": 3.5713174634765967e-05, + "loss": 0.07176244258880615, + "mean_token_accuracy": 0.9754939571022987, + "num_tokens": 7185520.0, + "step": 3080 + }, + { + "epoch": 7.662515566625156, + "eval_entropy": 0.2526215241225653, + "eval_loss": 0.8265154361724854, + "eval_mean_token_accuracy": 0.8519952584837758, + "eval_num_tokens": 7185520.0, + "eval_runtime": 85.8746, + "eval_samples_per_second": 16.012, + "eval_steps_per_second": 2.003, + "step": 3080 + }, + { + "entropy": 0.13420484317466616, + "epoch": 7.712328767123288, + "grad_norm": 0.2398064285516739, + "learning_rate": 3.4292244132434866e-05, + "loss": 0.07559212446212768, + "mean_token_accuracy": 0.9743142127990723, + "num_tokens": 7232170.0, + "step": 3100 + }, + { + "epoch": 7.712328767123288, + "eval_entropy": 0.2484562756537005, + "eval_loss": 0.8312150239944458, + "eval_mean_token_accuracy": 0.8528405119513356, + "eval_num_tokens": 7232170.0, + "eval_runtime": 85.7896, + "eval_samples_per_second": 16.028, + "eval_steps_per_second": 2.005, + "step": 3100 + }, + { + "entropy": 0.11965563679113984, + "epoch": 7.76214196762142, + "grad_norm": 0.3408384919166565, + "learning_rate": 3.2895092955952746e-05, + "loss": 0.0661750853061676, + "mean_token_accuracy": 0.9776600524783134, + "num_tokens": 7282846.0, + "step": 3120 + }, + { + "epoch": 7.76214196762142, + "eval_entropy": 0.2522421533804993, + "eval_loss": 0.8327009677886963, + "eval_mean_token_accuracy": 0.8524222023958383, + "eval_num_tokens": 7282846.0, + "eval_runtime": 86.1769, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 1.996, + "step": 3120 + }, + { + "entropy": 0.13388084415346385, + "epoch": 7.811955168119551, + "grad_norm": 0.35418516397476196, + "learning_rate": 3.152214246705829e-05, + "loss": 0.07149899601936341, + "mean_token_accuracy": 0.9747635535895824, + "num_tokens": 7331518.0, + "step": 3140 + }, + { + "epoch": 7.811955168119551, + "eval_entropy": 0.25038352296795957, + "eval_loss": 0.836457371711731, + "eval_mean_token_accuracy": 0.8526130665180295, + "eval_num_tokens": 7331518.0, + "eval_runtime": 85.6099, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.009, + "step": 3140 + }, + { + "entropy": 0.13530643959529698, + "epoch": 7.861768368617684, + "grad_norm": 0.38060539960861206, + "learning_rate": 3.017380672889291e-05, + "loss": 0.07116585969924927, + "mean_token_accuracy": 0.973284512758255, + "num_tokens": 7379056.0, + "step": 3160 + }, + { + "epoch": 7.861768368617684, + "eval_entropy": 0.255092611319797, + "eval_loss": 0.8314701914787292, + "eval_mean_token_accuracy": 0.8520913099826768, + "eval_num_tokens": 7379056.0, + "eval_runtime": 85.877, + "eval_samples_per_second": 16.011, + "eval_steps_per_second": 2.003, + "step": 3160 + }, + { + "entropy": 0.13383390177041293, + "epoch": 7.911581569115816, + "grad_norm": 0.3827536106109619, + "learning_rate": 2.8850492381124808e-05, + "loss": 0.07305437326431274, + "mean_token_accuracy": 0.9750778004527092, + "num_tokens": 7424770.0, + "step": 3180 + }, + { + "epoch": 7.911581569115816, + "eval_entropy": 0.25416371157003004, + "eval_loss": 0.8206402063369751, + "eval_mean_token_accuracy": 0.852779901651449, + "eval_num_tokens": 7424770.0, + "eval_runtime": 86.1015, + "eval_samples_per_second": 15.97, + "eval_steps_per_second": 1.998, + "step": 3180 + }, + { + "entropy": 0.1395680439658463, + "epoch": 7.961394769613948, + "grad_norm": 0.3809775412082672, + "learning_rate": 2.7552598517312256e-05, + "loss": 0.07236042022705078, + "mean_token_accuracy": 0.9731538116931915, + "num_tokens": 7470804.0, + "step": 3200 + }, + { + "epoch": 7.961394769613948, + "eval_entropy": 0.25528111975899964, + "eval_loss": 0.8230037093162537, + "eval_mean_token_accuracy": 0.8526452603035195, + "eval_num_tokens": 7470804.0, + "eval_runtime": 85.7895, + "eval_samples_per_second": 16.028, + "eval_steps_per_second": 2.005, + "step": 3200 + }, + { + "entropy": 0.12193699864049752, + "epoch": 8.009962640099626, + "grad_norm": 0.11854425817728043, + "learning_rate": 2.6280516564542205e-05, + "loss": 0.06617764234542847, + "mean_token_accuracy": 0.977179691577569, + "num_tokens": 7518110.0, + "step": 3220 + }, + { + "epoch": 8.009962640099626, + "eval_entropy": 0.25100527677771656, + "eval_loss": 0.8393343687057495, + "eval_mean_token_accuracy": 0.8522553132023922, + "eval_num_tokens": 7518110.0, + "eval_runtime": 85.8837, + "eval_samples_per_second": 16.01, + "eval_steps_per_second": 2.003, + "step": 3220 + }, + { + "entropy": 0.12788885813206435, + "epoch": 8.059775840597759, + "grad_norm": 0.16094881296157837, + "learning_rate": 2.50346301653812e-05, + "loss": 0.06274186968803405, + "mean_token_accuracy": 0.9766994707286358, + "num_tokens": 7565539.0, + "step": 3240 + }, + { + "epoch": 8.059775840597759, + "eval_entropy": 0.24409458682287571, + "eval_loss": 0.874617338180542, + "eval_mean_token_accuracy": 0.8521041180505309, + "eval_num_tokens": 7565539.0, + "eval_runtime": 86.2656, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 3240 + }, + { + "entropy": 0.12464155335910618, + "epoch": 8.10958904109589, + "grad_norm": 0.16893954575061798, + "learning_rate": 2.381531506217437e-05, + "loss": 0.06093020439147949, + "mean_token_accuracy": 0.9776258453726768, + "num_tokens": 7612578.0, + "step": 3260 + }, + { + "epoch": 8.10958904109589, + "eval_entropy": 0.24396493017326953, + "eval_loss": 0.891161322593689, + "eval_mean_token_accuracy": 0.8515338024427724, + "eval_num_tokens": 7612578.0, + "eval_runtime": 85.9061, + "eval_samples_per_second": 16.006, + "eval_steps_per_second": 2.002, + "step": 3260 + }, + { + "entropy": 0.12345920228399336, + "epoch": 8.159402241594023, + "grad_norm": 0.14332273602485657, + "learning_rate": 2.262293898372616e-05, + "loss": 0.061289966106414795, + "mean_token_accuracy": 0.9762230902910233, + "num_tokens": 7660157.0, + "step": 3280 + }, + { + "epoch": 8.159402241594023, + "eval_entropy": 0.2481445314059424, + "eval_loss": 0.8922848105430603, + "eval_mean_token_accuracy": 0.8514944855556932, + "eval_num_tokens": 7660157.0, + "eval_runtime": 85.5201, + "eval_samples_per_second": 16.078, + "eval_steps_per_second": 2.011, + "step": 3280 + }, + { + "entropy": 0.12298110066913068, + "epoch": 8.209215442092155, + "grad_norm": 0.21848882734775543, + "learning_rate": 2.1457861534398633e-05, + "loss": 0.05986443758010864, + "mean_token_accuracy": 0.9786281704902648, + "num_tokens": 7709745.0, + "step": 3300 + }, + { + "epoch": 8.209215442092155, + "eval_entropy": 0.24329388124305149, + "eval_loss": 0.9021085500717163, + "eval_mean_token_accuracy": 0.8521762625422589, + "eval_num_tokens": 7709745.0, + "eval_runtime": 85.955, + "eval_samples_per_second": 15.997, + "eval_steps_per_second": 2.001, + "step": 3300 + }, + { + "entropy": 0.13265180448070168, + "epoch": 8.259028642590286, + "grad_norm": 0.18067947030067444, + "learning_rate": 2.0320434085659692e-05, + "loss": 0.06724961400032044, + "mean_token_accuracy": 0.975098168104887, + "num_tokens": 7753571.0, + "step": 3320 + }, + { + "epoch": 8.259028642590286, + "eval_entropy": 0.2433211464694766, + "eval_loss": 0.9094350337982178, + "eval_mean_token_accuracy": 0.8520150094531304, + "eval_num_tokens": 7753571.0, + "eval_runtime": 85.7989, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.005, + "step": 3320 + }, + { + "entropy": 0.11949320202693343, + "epoch": 8.308841843088418, + "grad_norm": 0.17020289599895477, + "learning_rate": 1.9210999670114196e-05, + "loss": 0.0634455680847168, + "mean_token_accuracy": 0.9771294385194779, + "num_tokens": 7799310.0, + "step": 3340 + }, + { + "epoch": 8.308841843088418, + "eval_entropy": 0.24345201219237128, + "eval_loss": 0.9021793603897095, + "eval_mean_token_accuracy": 0.8520745697409607, + "eval_num_tokens": 7799310.0, + "eval_runtime": 86.0883, + "eval_samples_per_second": 15.972, + "eval_steps_per_second": 1.998, + "step": 3340 + }, + { + "entropy": 0.12065747743472457, + "epoch": 8.35865504358655, + "grad_norm": 0.16789060831069946, + "learning_rate": 1.8129892878049886e-05, + "loss": 0.061494195461273195, + "mean_token_accuracy": 0.9779584899544715, + "num_tokens": 7846447.0, + "step": 3360 + }, + { + "epoch": 8.35865504358655, + "eval_entropy": 0.24093415042342142, + "eval_loss": 0.9006755352020264, + "eval_mean_token_accuracy": 0.852174230786257, + "eval_num_tokens": 7846447.0, + "eval_runtime": 85.9011, + "eval_samples_per_second": 16.007, + "eval_steps_per_second": 2.002, + "step": 3360 + }, + { + "entropy": 0.13125578537583352, + "epoch": 8.408468244084682, + "grad_norm": 0.1662452220916748, + "learning_rate": 1.70774397565298e-05, + "loss": 0.06685600876808166, + "mean_token_accuracy": 0.9744067586958408, + "num_tokens": 7890283.0, + "step": 3380 + }, + { + "epoch": 8.408468244084682, + "eval_entropy": 0.24062153688350388, + "eval_loss": 0.9078915119171143, + "eval_mean_token_accuracy": 0.8523201647886011, + "eval_num_tokens": 7890283.0, + "eval_runtime": 86.0201, + "eval_samples_per_second": 15.985, + "eval_steps_per_second": 2.0, + "step": 3380 + }, + { + "entropy": 0.11986117120832204, + "epoch": 8.458281444582815, + "grad_norm": 0.19571948051452637, + "learning_rate": 1.6053957711060606e-05, + "loss": 0.06411095261573792, + "mean_token_accuracy": 0.9770627245306969, + "num_tokens": 7936518.0, + "step": 3400 + }, + { + "epoch": 8.458281444582815, + "eval_entropy": 0.24352820347561394, + "eval_loss": 0.9058943390846252, + "eval_mean_token_accuracy": 0.8519382792156797, + "eval_num_tokens": 7936518.0, + "eval_runtime": 85.966, + "eval_samples_per_second": 15.995, + "eval_steps_per_second": 2.001, + "step": 3400 + }, + { + "entropy": 0.12857897616922856, + "epoch": 8.508094645080947, + "grad_norm": 0.2609264850616455, + "learning_rate": 1.5059755409867613e-05, + "loss": 0.06473397612571716, + "mean_token_accuracy": 0.9764650195837021, + "num_tokens": 7981966.0, + "step": 3420 + }, + { + "epoch": 8.508094645080947, + "eval_entropy": 0.24032609000108962, + "eval_loss": 0.9077776074409485, + "eval_mean_token_accuracy": 0.8517829197090726, + "eval_num_tokens": 7981966.0, + "eval_runtime": 86.6059, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 3420 + }, + { + "entropy": 0.12348870886489749, + "epoch": 8.557907845579079, + "grad_norm": 0.19537609815597534, + "learning_rate": 1.409513269080473e-05, + "loss": 0.06481348872184753, + "mean_token_accuracy": 0.9769559659063816, + "num_tokens": 8028367.0, + "step": 3440 + }, + { + "epoch": 8.557907845579079, + "eval_entropy": 0.2404322574824788, + "eval_loss": 0.9057720899581909, + "eval_mean_token_accuracy": 0.8521037981953732, + "eval_num_tokens": 8028367.0, + "eval_runtime": 86.166, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.996, + "step": 3440 + }, + { + "entropy": 0.12040232736617326, + "epoch": 8.607721046077211, + "grad_norm": 0.3310582935810089, + "learning_rate": 1.3160380470927183e-05, + "loss": 0.06468871235847473, + "mean_token_accuracy": 0.9768650442361831, + "num_tokens": 8074934.0, + "step": 3460 + }, + { + "epoch": 8.607721046077211, + "eval_entropy": 0.24118655876711356, + "eval_loss": 0.9028318524360657, + "eval_mean_token_accuracy": 0.8521025340224422, + "eval_num_tokens": 8074934.0, + "eval_runtime": 85.3668, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.015, + "step": 3460 + }, + { + "entropy": 0.12328103906475008, + "epoch": 8.657534246575342, + "grad_norm": 0.12836167216300964, + "learning_rate": 1.2255780658755122e-05, + "loss": 0.06229386329650879, + "mean_token_accuracy": 0.9763277888298034, + "num_tokens": 8122775.0, + "step": 3480 + }, + { + "epoch": 8.657534246575342, + "eval_entropy": 0.24194598145956217, + "eval_loss": 0.9009329080581665, + "eval_mean_token_accuracy": 0.8521693289973015, + "eval_num_tokens": 8122775.0, + "eval_runtime": 85.9415, + "eval_samples_per_second": 15.999, + "eval_steps_per_second": 2.001, + "step": 3480 + }, + { + "entropy": 0.11321646976284683, + "epoch": 8.707347447073474, + "grad_norm": 0.15656894445419312, + "learning_rate": 1.1381606069253786e-05, + "loss": 0.05908188819885254, + "mean_token_accuracy": 0.9779504477977753, + "num_tokens": 8174307.0, + "step": 3500 + }, + { + "epoch": 8.707347447073474, + "eval_entropy": 0.24121542517528977, + "eval_loss": 0.9016091823577881, + "eval_mean_token_accuracy": 0.8521790667328724, + "eval_num_tokens": 8174307.0, + "eval_runtime": 85.7465, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.006, + "step": 3500 + }, + { + "entropy": 0.12657046681270004, + "epoch": 8.757160647571606, + "grad_norm": 0.22597502171993256, + "learning_rate": 1.053812034155629e-05, + "loss": 0.06244581937789917, + "mean_token_accuracy": 0.976795207709074, + "num_tokens": 8222808.0, + "step": 3520 + }, + { + "epoch": 8.757160647571606, + "eval_entropy": 0.23877542708502258, + "eval_loss": 0.9069110155105591, + "eval_mean_token_accuracy": 0.8522880177858264, + "eval_num_tokens": 8222808.0, + "eval_runtime": 85.7792, + "eval_samples_per_second": 16.03, + "eval_steps_per_second": 2.005, + "step": 3520 + }, + { + "entropy": 0.11422101808711886, + "epoch": 8.806973848069738, + "grad_norm": 0.21139323711395264, + "learning_rate": 9.725577859453502e-06, + "loss": 0.05988085865974426, + "mean_token_accuracy": 0.9779510758817196, + "num_tokens": 8273335.0, + "step": 3540 + }, + { + "epoch": 8.806973848069738, + "eval_entropy": 0.2393161087881687, + "eval_loss": 0.9033801555633545, + "eval_mean_token_accuracy": 0.8522614209457885, + "eval_num_tokens": 8273335.0, + "eval_runtime": 85.5594, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 3540 + }, + { + "entropy": 0.13810604228638113, + "epoch": 8.85678704856787, + "grad_norm": 0.24571993947029114, + "learning_rate": 8.944223674675537e-06, + "loss": 0.07036117911338806, + "mean_token_accuracy": 0.9734892748296261, + "num_tokens": 8315235.0, + "step": 3560 + }, + { + "epoch": 8.85678704856787, + "eval_entropy": 0.23998506947658782, + "eval_loss": 0.9009848833084106, + "eval_mean_token_accuracy": 0.8521793619837872, + "eval_num_tokens": 8315235.0, + "eval_runtime": 86.0974, + "eval_samples_per_second": 15.97, + "eval_steps_per_second": 1.998, + "step": 3560 + }, + { + "entropy": 0.14193559321574867, + "epoch": 8.906600249066003, + "grad_norm": 0.17304112017154694, + "learning_rate": 8.194293432987386e-06, + "loss": 0.07077967524528503, + "mean_token_accuracy": 0.973305893689394, + "num_tokens": 8358099.0, + "step": 3580 + }, + { + "epoch": 8.906600249066003, + "eval_entropy": 0.23883876689644748, + "eval_loss": 0.9015622138977051, + "eval_mean_token_accuracy": 0.8524864378363587, + "eval_num_tokens": 8358099.0, + "eval_runtime": 86.0089, + "eval_samples_per_second": 15.987, + "eval_steps_per_second": 2.0, + "step": 3580 + }, + { + "entropy": 0.11878943420015275, + "epoch": 8.956413449564135, + "grad_norm": 0.19075658917427063, + "learning_rate": 7.476013303121426e-06, + "loss": 0.060806107521057126, + "mean_token_accuracy": 0.9776863709092141, + "num_tokens": 8407430.0, + "step": 3600 + }, + { + "epoch": 8.956413449564135, + "eval_entropy": 0.23726526309931, + "eval_loss": 0.9060276746749878, + "eval_mean_token_accuracy": 0.8524192058762838, + "eval_num_tokens": 8407430.0, + "eval_runtime": 85.7252, + "eval_samples_per_second": 16.04, + "eval_steps_per_second": 2.006, + "step": 3600 + }, + { + "entropy": 0.1255835090787747, + "epoch": 9.004981320049813, + "grad_norm": 0.11608047038316727, + "learning_rate": 6.78959990856799e-06, + "loss": 0.06319612860679627, + "mean_token_accuracy": 0.9766685519462976, + "num_tokens": 8453175.0, + "step": 3620 + }, + { + "epoch": 9.004981320049813, + "eval_entropy": 0.2373251837006835, + "eval_loss": 0.9045722484588623, + "eval_mean_token_accuracy": 0.8525558363559634, + "eval_num_tokens": 8453175.0, + "eval_runtime": 85.7435, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.006, + "step": 3620 + }, + { + "entropy": 0.12587778437882663, + "epoch": 9.054794520547945, + "grad_norm": 0.1564614623785019, + "learning_rate": 6.135260262244683e-06, + "loss": 0.0630365788936615, + "mean_token_accuracy": 0.9777486085891723, + "num_tokens": 8497151.0, + "step": 3640 + }, + { + "epoch": 9.054794520547945, + "eval_entropy": 0.23559923721260803, + "eval_loss": 0.9120694398880005, + "eval_mean_token_accuracy": 0.8525292966947999, + "eval_num_tokens": 8497151.0, + "eval_runtime": 85.8018, + "eval_samples_per_second": 16.025, + "eval_steps_per_second": 2.005, + "step": 3640 + }, + { + "entropy": 0.12535365503281354, + "epoch": 9.104607721046078, + "grad_norm": 0.1404249221086502, + "learning_rate": 5.513191704064086e-06, + "loss": 0.060502654314041136, + "mean_token_accuracy": 0.9770058333873749, + "num_tokens": 8542996.0, + "step": 3660 + }, + { + "epoch": 9.104607721046078, + "eval_entropy": 0.23525122691725575, + "eval_loss": 0.9182237982749939, + "eval_mean_token_accuracy": 0.8524098333924316, + "eval_num_tokens": 8542996.0, + "eval_runtime": 85.9872, + "eval_samples_per_second": 15.991, + "eval_steps_per_second": 2.0, + "step": 3660 + }, + { + "entropy": 0.11330419047735632, + "epoch": 9.15442092154421, + "grad_norm": 0.15513843297958374, + "learning_rate": 4.92358184141876e-06, + "loss": 0.05822383761405945, + "mean_token_accuracy": 0.9793384782969952, + "num_tokens": 8591625.0, + "step": 3680 + }, + { + "epoch": 9.15442092154421, + "eval_entropy": 0.2353947116711805, + "eval_loss": 0.9229223132133484, + "eval_mean_token_accuracy": 0.852500357253607, + "eval_num_tokens": 8591625.0, + "eval_runtime": 86.0805, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.998, + "step": 3680 + }, + { + "entropy": 0.11830627010203898, + "epoch": 9.204234122042342, + "grad_norm": 0.1730550080537796, + "learning_rate": 4.366608492601456e-06, + "loss": 0.05860854983329773, + "mean_token_accuracy": 0.9779663667082786, + "num_tokens": 8639845.0, + "step": 3700 + }, + { + "epoch": 9.204234122042342, + "eval_entropy": 0.23567205719476522, + "eval_loss": 0.9269373416900635, + "eval_mean_token_accuracy": 0.8523658004611038, + "eval_num_tokens": 8639845.0, + "eval_runtime": 85.9809, + "eval_samples_per_second": 15.992, + "eval_steps_per_second": 2.0, + "step": 3700 + }, + { + "entropy": 0.1180900705512613, + "epoch": 9.254047322540472, + "grad_norm": 0.20909737050533295, + "learning_rate": 3.842439633177387e-06, + "loss": 0.059438884258270264, + "mean_token_accuracy": 0.9786856278777123, + "num_tokens": 8687194.0, + "step": 3720 + }, + { + "epoch": 9.254047322540472, + "eval_entropy": 0.23602714493524196, + "eval_loss": 0.9293538928031921, + "eval_mean_token_accuracy": 0.8523273440294488, + "eval_num_tokens": 8687194.0, + "eval_runtime": 85.2118, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.019, + "step": 3720 + }, + { + "entropy": 0.13156692241318524, + "epoch": 9.303860523038605, + "grad_norm": 0.12535709142684937, + "learning_rate": 3.3512333453253305e-06, + "loss": 0.06337688565254211, + "mean_token_accuracy": 0.9756712593138218, + "num_tokens": 8731721.0, + "step": 3740 + }, + { + "epoch": 9.303860523038605, + "eval_entropy": 0.23534389351343, + "eval_loss": 0.932999312877655, + "eval_mean_token_accuracy": 0.8523333925147389, + "eval_num_tokens": 8731721.0, + "eval_runtime": 85.953, + "eval_samples_per_second": 15.997, + "eval_steps_per_second": 2.001, + "step": 3740 + }, + { + "entropy": 0.12327516414225101, + "epoch": 9.353673723536737, + "grad_norm": 0.16341575980186462, + "learning_rate": 2.8931377701619306e-06, + "loss": 0.05869622826576233, + "mean_token_accuracy": 0.9784224212169648, + "num_tokens": 8778614.0, + "step": 3760 + }, + { + "epoch": 9.353673723536737, + "eval_entropy": 0.23493653622477553, + "eval_loss": 0.9358566999435425, + "eval_mean_token_accuracy": 0.8522722783476807, + "eval_num_tokens": 8778614.0, + "eval_runtime": 85.2538, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.018, + "step": 3760 + }, + { + "entropy": 0.1134357453789562, + "epoch": 9.403486924034869, + "grad_norm": 0.23999616503715515, + "learning_rate": 2.4682910630645723e-06, + "loss": 0.057540220022201535, + "mean_token_accuracy": 0.9798057802021504, + "num_tokens": 8826551.0, + "step": 3780 + }, + { + "epoch": 9.403486924034869, + "eval_entropy": 0.23470525634150172, + "eval_loss": 0.937556266784668, + "eval_mean_token_accuracy": 0.8523351706044618, + "eval_num_tokens": 8826551.0, + "eval_runtime": 85.7764, + "eval_samples_per_second": 16.03, + "eval_steps_per_second": 2.005, + "step": 3780 + }, + { + "entropy": 0.1075570048764348, + "epoch": 9.453300124533001, + "grad_norm": 0.15417765080928802, + "learning_rate": 2.0768213520055406e-06, + "loss": 0.05581026673316956, + "mean_token_accuracy": 0.9797527104616165, + "num_tokens": 8876556.0, + "step": 3800 + }, + { + "epoch": 9.453300124533001, + "eval_entropy": 0.2347462713545145, + "eval_loss": 0.9383137226104736, + "eval_mean_token_accuracy": 0.8522575324357942, + "eval_num_tokens": 8876556.0, + "eval_runtime": 85.8985, + "eval_samples_per_second": 16.007, + "eval_steps_per_second": 2.002, + "step": 3800 + }, + { + "entropy": 0.12609313456341625, + "epoch": 9.503113325031133, + "grad_norm": 0.22041426599025726, + "learning_rate": 1.7188466989102739e-06, + "loss": 0.06379218697547913, + "mean_token_accuracy": 0.9763593293726445, + "num_tokens": 8920286.0, + "step": 3820 + }, + { + "epoch": 9.503113325031133, + "eval_entropy": 0.23459658849724505, + "eval_loss": 0.9393337965011597, + "eval_mean_token_accuracy": 0.8523633532052817, + "eval_num_tokens": 8920286.0, + "eval_runtime": 85.9348, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.002, + "step": 3820 + }, + { + "entropy": 0.12149709439836442, + "epoch": 9.552926525529266, + "grad_norm": 0.16608643531799316, + "learning_rate": 1.3944750640516357e-06, + "loss": 0.06341606974601746, + "mean_token_accuracy": 0.9771503552794456, + "num_tokens": 8964464.0, + "step": 3840 + }, + { + "epoch": 9.552926525529266, + "eval_entropy": 0.2347291322468325, + "eval_loss": 0.9399036765098572, + "eval_mean_token_accuracy": 0.8523768914300341, + "eval_num_tokens": 8964464.0, + "eval_runtime": 86.1305, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.997, + "step": 3840 + }, + { + "entropy": 0.11724846777506173, + "epoch": 9.602739726027398, + "grad_norm": 0.13613300025463104, + "learning_rate": 1.103804273490497e-06, + "loss": 0.05994418263435364, + "mean_token_accuracy": 0.9778759330511093, + "num_tokens": 9010414.0, + "step": 3860 + }, + { + "epoch": 9.602739726027398, + "eval_entropy": 0.23495923337894817, + "eval_loss": 0.9400841593742371, + "eval_mean_token_accuracy": 0.8523780471363733, + "eval_num_tokens": 9010414.0, + "eval_runtime": 86.0379, + "eval_samples_per_second": 15.981, + "eval_steps_per_second": 1.999, + "step": 3860 + }, + { + "entropy": 0.12054574331268668, + "epoch": 9.65255292652553, + "grad_norm": 0.11884245276451111, + "learning_rate": 8.469219895727582e-07, + "loss": 0.05917409062385559, + "mean_token_accuracy": 0.9771256923675538, + "num_tokens": 9058053.0, + "step": 3880 + }, + { + "epoch": 9.65255292652553, + "eval_entropy": 0.23499552723626757, + "eval_loss": 0.9404177665710449, + "eval_mean_token_accuracy": 0.8523571678372317, + "eval_num_tokens": 9058053.0, + "eval_runtime": 86.0174, + "eval_samples_per_second": 15.985, + "eval_steps_per_second": 2.0, + "step": 3880 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.8251104598078464e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3900/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3900/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3900/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3900/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3900/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3900/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3900/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3900/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3900/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3900/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3900/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3900/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3900/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3900/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..ddce50db3e69fcf4ccfbf9fd6c466c6b898e443e --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3900/trainer_state.json @@ -0,0 +1,4129 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 9.70236612702366, + "eval_steps": 20, + "global_step": 3900, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + }, + { + "entropy": 0.561330484598875, + "epoch": 1.891656288916563, + "grad_norm": 0.6722865700721741, + "learning_rate": 0.0002208867897174789, + "loss": 0.499837589263916, + "mean_token_accuracy": 0.8518734864890576, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.5865232653396074, + "eval_loss": 0.5437926650047302, + "eval_mean_token_accuracy": 0.8450997017843779, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4116, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.547389242425561, + "epoch": 1.9414694894146949, + "grad_norm": 0.7935577034950256, + "learning_rate": 0.00022027119820226907, + "loss": 0.4977591514587402, + "mean_token_accuracy": 0.8539491161704064, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.5290903090391048, + "eval_loss": 0.5409526824951172, + "eval_mean_token_accuracy": 0.8497545698354411, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.7262, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 780 + }, + { + "entropy": 0.5687909748405218, + "epoch": 1.9912826899128269, + "grad_norm": 0.6180546283721924, + "learning_rate": 0.00021962329729698345, + "loss": 0.5109643459320068, + "mean_token_accuracy": 0.8521598495543004, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.5503541858390321, + "eval_loss": 0.5361555218696594, + "eval_mean_token_accuracy": 0.8510884285666221, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.3339, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 800 + }, + { + "entropy": 0.4739728841261986, + "epoch": 2.0398505603985058, + "grad_norm": 0.8058829307556152, + "learning_rate": 0.0002189432823996982, + "loss": 0.4204097747802734, + "mean_token_accuracy": 0.8728981889211215, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.5077334992414297, + "eval_loss": 0.5531114339828491, + "eval_mean_token_accuracy": 0.8489257208136625, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.4801, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.989, + "step": 820 + }, + { + "entropy": 0.4594309840351343, + "epoch": 2.0896637608966375, + "grad_norm": 0.6906896829605103, + "learning_rate": 0.0002182313585936314, + "loss": 0.4071959495544434, + "mean_token_accuracy": 0.8732857562601566, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.49850136994622474, + "eval_loss": 0.5486204624176025, + "eval_mean_token_accuracy": 0.8507991450470548, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.3364, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.4881629109382629, + "epoch": 2.1394769613947697, + "grad_norm": 0.6343470215797424, + "learning_rate": 0.0002174877405852928, + "loss": 0.41669540405273436, + "mean_token_accuracy": 0.8711295068264008, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.49155513924914734, + "eval_loss": 0.555109441280365, + "eval_mean_token_accuracy": 0.8496399400539176, + "eval_num_tokens": 2008562.0, + "eval_runtime": 86.3295, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 860 + }, + { + "entropy": 0.4648668970912695, + "epoch": 2.1892901618929015, + "grad_norm": 0.8014165163040161, + "learning_rate": 0.00021671265263973133, + "loss": 0.4110250473022461, + "mean_token_accuracy": 0.8754166305065155, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.4909258722219356, + "eval_loss": 0.5539511442184448, + "eval_mean_token_accuracy": 0.8492401502160138, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.3468, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 880 + }, + { + "entropy": 0.4824485514312983, + "epoch": 2.2391033623910337, + "grad_norm": 0.6665191054344177, + "learning_rate": 0.00021590632851289967, + "loss": 0.4181404113769531, + "mean_token_accuracy": 0.8726993151009083, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.4986876940657926, + "eval_loss": 0.547695517539978, + "eval_mean_token_accuracy": 0.8501384708770486, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.3838, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 900 + }, + { + "entropy": 0.4751896943897009, + "epoch": 2.2889165628891655, + "grad_norm": 0.81158047914505, + "learning_rate": 0.00021506901138115678, + "loss": 0.40689678192138673, + "mean_token_accuracy": 0.8745221219956875, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.507153491121392, + "eval_loss": 0.5501641631126404, + "eval_mean_token_accuracy": 0.8495670116918032, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.0912, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 920 + }, + { + "entropy": 0.4873133715242147, + "epoch": 2.3387297633872977, + "grad_norm": 0.7218056321144104, + "learning_rate": 0.0002142009537679292, + "loss": 0.42701358795166017, + "mean_token_accuracy": 0.8695114746689796, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5202612736543943, + "eval_loss": 0.5491839051246643, + "eval_mean_token_accuracy": 0.8494071208460386, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.1142, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 940 + }, + { + "entropy": 0.4762951169162989, + "epoch": 2.3885429638854294, + "grad_norm": 0.7194424867630005, + "learning_rate": 0.0002133024174675534, + "loss": 0.42299847602844237, + "mean_token_accuracy": 0.8709790132939815, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4899340462546016, + "eval_loss": 0.5522511601448059, + "eval_mean_token_accuracy": 0.8492208258357159, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.463, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 960 + }, + { + "entropy": 0.49650347977876663, + "epoch": 2.4383561643835616, + "grad_norm": 0.8406022787094116, + "learning_rate": 0.0002123736734663221, + "loss": 0.4275330066680908, + "mean_token_accuracy": 0.8670595556497573, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.49691385654515996, + "eval_loss": 0.5491269826889038, + "eval_mean_token_accuracy": 0.850309816210769, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.17, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 980 + }, + { + "entropy": 0.48843890577554705, + "epoch": 2.488169364881694, + "grad_norm": 0.9082473516464233, + "learning_rate": 0.00021141500186075868, + "loss": 0.4309722423553467, + "mean_token_accuracy": 0.8686766296625137, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5543508351195691, + "eval_loss": 0.5478800535202026, + "eval_mean_token_accuracy": 0.8478029522784921, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.3835, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 1000 + }, + { + "entropy": 0.4777219031006098, + "epoch": 2.5379825653798256, + "grad_norm": 0.7448089122772217, + "learning_rate": 0.0002104266917731438, + "loss": 0.423325252532959, + "mean_token_accuracy": 0.8706337086856365, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.49857561550168106, + "eval_loss": 0.5511948466300964, + "eval_mean_token_accuracy": 0.8502220289651737, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.5399, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.988, + "step": 1020 + }, + { + "entropy": 0.4844174191355705, + "epoch": 2.587795765877958, + "grad_norm": 0.794029176235199, + "learning_rate": 0.00020940904126432, + "loss": 0.4176753044128418, + "mean_token_accuracy": 0.873535567522049, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.485467542222766, + "eval_loss": 0.5539286732673645, + "eval_mean_token_accuracy": 0.8495475081510322, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.135, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 1.997, + "step": 1040 + }, + { + "entropy": 0.49070929251611234, + "epoch": 2.6376089663760895, + "grad_norm": 0.7558256983757019, + "learning_rate": 0.0002083623572438007, + "loss": 0.42867293357849123, + "mean_token_accuracy": 0.8696666076779366, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.490822730889154, + "eval_loss": 0.5434785485267639, + "eval_mean_token_accuracy": 0.850568296950917, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.4933, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 1060 + }, + { + "entropy": 0.47806114703416824, + "epoch": 2.6874221668742218, + "grad_norm": 0.6608979105949402, + "learning_rate": 0.00020728695537721047, + "loss": 0.4289727687835693, + "mean_token_accuracy": 0.8693130135536193, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.5285773256490397, + "eval_loss": 0.5444230437278748, + "eval_mean_token_accuracy": 0.8498796481032704, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.7091, + "eval_samples_per_second": 15.858, + "eval_steps_per_second": 1.984, + "step": 1080 + }, + { + "entropy": 0.5046216730028391, + "epoch": 2.7372353673723535, + "grad_norm": 0.8428544998168945, + "learning_rate": 0.00020618315999108454, + "loss": 0.43131070137023925, + "mean_token_accuracy": 0.8701941035687923, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.49888394738352576, + "eval_loss": 0.5459766387939453, + "eval_mean_token_accuracy": 0.8511758872935938, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.2222, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.995, + "step": 1100 + }, + { + "entropy": 0.5212558470666409, + "epoch": 2.7870485678704857, + "grad_norm": 1.129318118095398, + "learning_rate": 0.00020505130397505635, + "loss": 0.44249300956726073, + "mean_token_accuracy": 0.8654101334512234, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5179622324053631, + "eval_loss": 0.5522801280021667, + "eval_mean_token_accuracy": 0.8497019947268242, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.1903, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.996, + "step": 1120 + }, + { + "entropy": 0.4988406613469124, + "epoch": 2.8368617683686175, + "grad_norm": 0.6460545063018799, + "learning_rate": 0.00020389172868146263, + "loss": 0.4386270523071289, + "mean_token_accuracy": 0.8690383620560169, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.5042278484203094, + "eval_loss": 0.5433034300804138, + "eval_mean_token_accuracy": 0.8497674451317898, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.3028, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.993, + "step": 1140 + }, + { + "entropy": 0.4926559619605541, + "epoch": 2.8866749688667497, + "grad_norm": 0.8199329972267151, + "learning_rate": 0.00020270478382239615, + "loss": 0.4313485145568848, + "mean_token_accuracy": 0.8674727231264114, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.503873193160046, + "eval_loss": 0.5388111472129822, + "eval_mean_token_accuracy": 0.8526195034731266, + "eval_num_tokens": 2710196.0, + "eval_runtime": 86.4054, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.991, + "step": 1160 + }, + { + "entropy": 0.5020013231784105, + "epoch": 2.936488169364882, + "grad_norm": 0.7344821095466614, + "learning_rate": 0.00020149082736423723, + "loss": 0.43590536117553713, + "mean_token_accuracy": 0.8671772189438343, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5368241809828337, + "eval_loss": 0.5355703830718994, + "eval_mean_token_accuracy": 0.8517617773871089, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.2945, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1180 + }, + { + "entropy": 0.5112275708466768, + "epoch": 2.9863013698630136, + "grad_norm": 0.6951606869697571, + "learning_rate": 0.00020025022541969622, + "loss": 0.43579301834106443, + "mean_token_accuracy": 0.8641206480562686, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.5066795706055885, + "eval_loss": 0.5415249466896057, + "eval_mean_token_accuracy": 0.8493563373421513, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.5005, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.988, + "step": 1200 + }, + { + "entropy": 0.42298635305502474, + "epoch": 3.0348692403486925, + "grad_norm": 0.8201794028282166, + "learning_rate": 0.00019898335213739863, + "loss": 0.35593905448913576, + "mean_token_accuracy": 0.889238600547497, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.4584170470750609, + "eval_loss": 0.569487452507019, + "eval_mean_token_accuracy": 0.8495814173027526, + "eval_num_tokens": 2848509.0, + "eval_runtime": 86.2281, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 1220 + }, + { + "entropy": 0.37450140453875064, + "epoch": 3.0846824408468243, + "grad_norm": 0.7308394908905029, + "learning_rate": 0.0001976905895890471, + "loss": 0.307823920249939, + "mean_token_accuracy": 0.9001288741827012, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.45185995916294497, + "eval_loss": 0.5672881603240967, + "eval_mean_token_accuracy": 0.8511318519364955, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.0819, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.998, + "step": 1240 + }, + { + "entropy": 0.3887945845723152, + "epoch": 3.1344956413449565, + "grad_norm": 0.7299330830574036, + "learning_rate": 0.0001963723276541939, + "loss": 0.32047903537750244, + "mean_token_accuracy": 0.8960984498262405, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.44865354549053105, + "eval_loss": 0.5666037201881409, + "eval_mean_token_accuracy": 0.8496572649063066, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 1260 + }, + { + "entropy": 0.39677664265036583, + "epoch": 3.1843088418430883, + "grad_norm": 0.9533219933509827, + "learning_rate": 0.00019502896390265838, + "loss": 0.3253983497619629, + "mean_token_accuracy": 0.8964207418262958, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.4641980809527774, + "eval_loss": 0.5814996957778931, + "eval_mean_token_accuracy": 0.8485886212005171, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.7784, + "eval_samples_per_second": 15.845, + "eval_steps_per_second": 1.982, + "step": 1280 + }, + { + "entropy": 0.39210722744464876, + "epoch": 3.2341220423412205, + "grad_norm": 0.7447651028633118, + "learning_rate": 0.00019366090347462545, + "loss": 0.3276803970336914, + "mean_token_accuracy": 0.8930055953562259, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43595615254585135, + "eval_loss": 0.5722188353538513, + "eval_mean_token_accuracy": 0.8501105755567551, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.5271, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 1300 + }, + { + "entropy": 0.3684127271175385, + "epoch": 3.2839352428393527, + "grad_norm": 0.6934201121330261, + "learning_rate": 0.00019226855895846078, + "loss": 0.3156379222869873, + "mean_token_accuracy": 0.8976306475698947, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.4628148723480313, + "eval_loss": 0.5631352066993713, + "eval_mean_token_accuracy": 0.8504934813394103, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.3436, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 1320 + }, + { + "entropy": 0.4073401909321547, + "epoch": 3.3337484433374844, + "grad_norm": 0.9386897683143616, + "learning_rate": 0.00019085235026627994, + "loss": 0.34265310764312745, + "mean_token_accuracy": 0.8902062118053437, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.46455050623694133, + "eval_loss": 0.5586736798286438, + "eval_mean_token_accuracy": 0.8506874702004499, + "eval_num_tokens": 3132874.0, + "eval_runtime": 86.1286, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.997, + "step": 1340 + }, + { + "entropy": 0.4046429242938757, + "epoch": 3.383561643835616, + "grad_norm": 0.9633992314338684, + "learning_rate": 0.00018941270450730836, + "loss": 0.33816893100738527, + "mean_token_accuracy": 0.8927541889250279, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.46846531660750856, + "eval_loss": 0.561501681804657, + "eval_mean_token_accuracy": 0.8496256377114806, + "eval_num_tokens": 3178055.0, + "eval_runtime": 86.685, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1360 + }, + { + "entropy": 0.39872407019138334, + "epoch": 3.4333748443337484, + "grad_norm": 0.7786458730697632, + "learning_rate": 0.00018795005585907113, + "loss": 0.33342490196228025, + "mean_token_accuracy": 0.8944805048406124, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.42709505973860273, + "eval_loss": 0.5751848220825195, + "eval_mean_token_accuracy": 0.8507290447867194, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.6892, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 1380 + }, + { + "entropy": 0.3923338124528527, + "epoch": 3.4831880448318806, + "grad_norm": 0.9305956363677979, + "learning_rate": 0.0001864648454364511, + "loss": 0.33188116550445557, + "mean_token_accuracy": 0.8943330392241478, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.4386174779298694, + "eval_loss": 0.5680831074714661, + "eval_mean_token_accuracy": 0.8513129727784977, + "eval_num_tokens": 3274096.0, + "eval_runtime": 86.2671, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 1400 + }, + { + "entropy": 0.3856233984231949, + "epoch": 3.5330012453300124, + "grad_norm": 1.0362752676010132, + "learning_rate": 0.0001849575211586545, + "loss": 0.33098697662353516, + "mean_token_accuracy": 0.8961390435695649, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4574795474493226, + "eval_loss": 0.5630439519882202, + "eval_mean_token_accuracy": 0.8520988873964133, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.6035, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 1420 + }, + { + "entropy": 0.39812871962785723, + "epoch": 3.5828144458281446, + "grad_norm": 0.7807195782661438, + "learning_rate": 0.0001834285376141247, + "loss": 0.3333771228790283, + "mean_token_accuracy": 0.8930827379226685, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.4556825893909432, + "eval_loss": 0.5689062476158142, + "eval_mean_token_accuracy": 0.8507103507601937, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.1606, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.996, + "step": 1440 + }, + { + "entropy": 0.4147744856774807, + "epoch": 3.6326276463262763, + "grad_norm": 0.6429352164268494, + "learning_rate": 0.00018187835592344443, + "loss": 0.3482560873031616, + "mean_token_accuracy": 0.8910200245678425, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.46600024540757023, + "eval_loss": 0.5609709024429321, + "eval_mean_token_accuracy": 0.8491220876227977, + "eval_num_tokens": 3415600.0, + "eval_runtime": 86.8039, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1460 + }, + { + "entropy": 0.40425071083009245, + "epoch": 3.6824408468244085, + "grad_norm": 0.8613698482513428, + "learning_rate": 0.0001803074436002682, + "loss": 0.342916464805603, + "mean_token_accuracy": 0.8916418336331844, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.43855057899342026, + "eval_loss": 0.5720968246459961, + "eval_mean_token_accuracy": 0.8500823641932288, + "eval_num_tokens": 3460471.0, + "eval_runtime": 86.6746, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1480 + }, + { + "entropy": 0.39465143866837027, + "epoch": 3.7322540473225407, + "grad_norm": 0.6285189986228943, + "learning_rate": 0.0001787162744103265, + "loss": 0.3424591779708862, + "mean_token_accuracy": 0.8906558901071548, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4509461877304454, + "eval_loss": 0.5590082406997681, + "eval_mean_token_accuracy": 0.8511747371318729, + "eval_num_tokens": 3507647.0, + "eval_runtime": 86.8126, + "eval_samples_per_second": 15.839, + "eval_steps_per_second": 1.981, + "step": 1500 + }, + { + "entropy": 0.4021005939692259, + "epoch": 3.7820672478206725, + "grad_norm": 0.8821248412132263, + "learning_rate": 0.00017710532822854468, + "loss": 0.3462103843688965, + "mean_token_accuracy": 0.889109355956316, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.4502199075596277, + "eval_loss": 0.566046416759491, + "eval_mean_token_accuracy": 0.8501714208098345, + "eval_num_tokens": 3548934.0, + "eval_runtime": 86.8336, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.981, + "step": 1520 + }, + { + "entropy": 0.4017397932708263, + "epoch": 3.8318804483188043, + "grad_norm": 0.8400952816009521, + "learning_rate": 0.0001754750908943189, + "loss": 0.34890995025634763, + "mean_token_accuracy": 0.8892098367214203, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.4614003023435903, + "eval_loss": 0.5617933869361877, + "eval_mean_token_accuracy": 0.8515863616106122, + "eval_num_tokens": 3597186.0, + "eval_runtime": 86.4609, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 1540 + }, + { + "entropy": 0.4112051840871572, + "epoch": 3.8816936488169365, + "grad_norm": 0.769478440284729, + "learning_rate": 0.0001738260540649939, + "loss": 0.34711437225341796, + "mean_token_accuracy": 0.8911717928946018, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4540443811998811, + "eval_loss": 0.5576469898223877, + "eval_mean_token_accuracy": 0.8512079674144124, + "eval_num_tokens": 3646646.0, + "eval_runtime": 86.5103, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 1560 + }, + { + "entropy": 0.41105241514742374, + "epoch": 3.9315068493150687, + "grad_norm": 0.8468427062034607, + "learning_rate": 0.00017215871506758568, + "loss": 0.3433023452758789, + "mean_token_accuracy": 0.8898739732801915, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.4707539707075718, + "eval_loss": 0.5641466379165649, + "eval_mean_token_accuracy": 0.8495440957851188, + "eval_num_tokens": 3689560.0, + "eval_runtime": 86.609, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.986, + "step": 1580 + }, + { + "entropy": 0.41016379147768023, + "epoch": 3.9813200498132004, + "grad_norm": 0.7482675313949585, + "learning_rate": 0.0001704735767487946, + "loss": 0.34550890922546384, + "mean_token_accuracy": 0.8893028847873211, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.46391099864660307, + "eval_loss": 0.5593640804290771, + "eval_mean_token_accuracy": 0.8510130581467651, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.3975, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 1600 + }, + { + "entropy": 0.33167599791135544, + "epoch": 4.029887920298879, + "grad_norm": 0.9435692429542542, + "learning_rate": 0.00016877114732335337, + "loss": 0.2716026544570923, + "mean_token_accuracy": 0.9133149828666296, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.38499350005457567, + "eval_loss": 0.6298249363899231, + "eval_mean_token_accuracy": 0.8488117071778275, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.2933, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1620 + }, + { + "entropy": 0.3000166634097695, + "epoch": 4.0797011207970115, + "grad_norm": 0.8080845475196838, + "learning_rate": 0.0001670519402207569, + "loss": 0.22617182731628419, + "mean_token_accuracy": 0.9253474645316601, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.370110988703578, + "eval_loss": 0.6338461637496948, + "eval_mean_token_accuracy": 0.8485634801692741, + "eval_num_tokens": 3828830.0, + "eval_runtime": 85.9508, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.001, + "step": 1640 + }, + { + "entropy": 0.2986910421401262, + "epoch": 4.129514321295143, + "grad_norm": 0.7310900092124939, + "learning_rate": 0.0001653164739304185, + "loss": 0.22367463111877442, + "mean_token_accuracy": 0.9252275295555592, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.3944379702037157, + "eval_loss": 0.6109381914138794, + "eval_mean_token_accuracy": 0.849291454220927, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.6728, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1660 + }, + { + "entropy": 0.3095553796738386, + "epoch": 4.179327521793275, + "grad_norm": 0.7059140801429749, + "learning_rate": 0.0001635652718453007, + "loss": 0.23651680946350098, + "mean_token_accuracy": 0.9208931416273117, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.3910588648949945, + "eval_loss": 0.6104469299316406, + "eval_mean_token_accuracy": 0.8486883893262508, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7612, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.982, + "step": 1680 + }, + { + "entropy": 0.3001101028174162, + "epoch": 4.229140722291407, + "grad_norm": 0.6787802577018738, + "learning_rate": 0.00016179886210406728, + "loss": 0.23130471706390382, + "mean_token_accuracy": 0.9233332790434361, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3794369170832079, + "eval_loss": 0.6182110905647278, + "eval_mean_token_accuracy": 0.8495433777570724, + "eval_num_tokens": 3967474.0, + "eval_runtime": 85.94, + "eval_samples_per_second": 16.0, + "eval_steps_per_second": 2.001, + "step": 1700 + }, + { + "entropy": 0.3031421799212694, + "epoch": 4.2789539227895395, + "grad_norm": 0.9732038378715515, + "learning_rate": 0.0001600177774318036, + "loss": 0.2359529733657837, + "mean_token_accuracy": 0.9217648565769195, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3923123094231583, + "eval_loss": 0.6057384610176086, + "eval_mean_token_accuracy": 0.8508818288182103, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7647, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.29365369994193313, + "epoch": 4.328767123287671, + "grad_norm": 0.7681498527526855, + "learning_rate": 0.0001582225549793541, + "loss": 0.2269371747970581, + "mean_token_accuracy": 0.9245341829955578, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.4011661055129628, + "eval_loss": 0.6144486665725708, + "eval_mean_token_accuracy": 0.8480324357054955, + "eval_num_tokens": 4062594.0, + "eval_runtime": 87.1306, + "eval_samples_per_second": 15.781, + "eval_steps_per_second": 1.974, + "step": 1740 + }, + { + "entropy": 0.29396994728595016, + "epoch": 4.378580323785803, + "grad_norm": 1.0001007318496704, + "learning_rate": 0.0001564137361613248, + "loss": 0.22777395248413085, + "mean_token_accuracy": 0.9262309700250626, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38518730195802314, + "eval_loss": 0.6202630400657654, + "eval_mean_token_accuracy": 0.8493869807137999, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6616, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.3096018506214023, + "epoch": 4.428393524283935, + "grad_norm": 1.0448365211486816, + "learning_rate": 0.00015459186649280024, + "loss": 0.23696351051330566, + "mean_token_accuracy": 0.9217322513461113, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.3946371126140273, + "eval_loss": 0.6079026460647583, + "eval_mean_token_accuracy": 0.8492515852978063, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6582, + "eval_samples_per_second": 15.867, + "eval_steps_per_second": 1.985, + "step": 1780 + }, + { + "entropy": 0.32619857545942066, + "epoch": 4.478206724782067, + "grad_norm": 0.7210651636123657, + "learning_rate": 0.00015275749542482337, + "loss": 0.24651215076446534, + "mean_token_accuracy": 0.9177676141262054, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.3947690814560236, + "eval_loss": 0.6065912246704102, + "eval_mean_token_accuracy": 0.8502957744653835, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.5959, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.986, + "step": 1800 + }, + { + "entropy": 0.3193941755220294, + "epoch": 4.5280199252802, + "grad_norm": 0.8281906843185425, + "learning_rate": 0.0001509111761786888, + "loss": 0.23936262130737304, + "mean_token_accuracy": 0.9201708927750587, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38704028864239537, + "eval_loss": 0.6006569266319275, + "eval_mean_token_accuracy": 0.8502406720505205, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.8059, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1820 + }, + { + "entropy": 0.3164879363030195, + "epoch": 4.577833125778331, + "grad_norm": 0.7892968654632568, + "learning_rate": 0.00014905346557909867, + "loss": 0.24541733264923096, + "mean_token_accuracy": 0.9175932116806507, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.38861122120951497, + "eval_loss": 0.6115967631340027, + "eval_mean_token_accuracy": 0.849471275196519, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.2946, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1840 + }, + { + "entropy": 0.3051785985007882, + "epoch": 4.627646326276463, + "grad_norm": 0.8109654188156128, + "learning_rate": 0.0001471849238862319, + "loss": 0.23433220386505127, + "mean_token_accuracy": 0.9206570319831371, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.37162452295076015, + "eval_loss": 0.6184061765670776, + "eval_mean_token_accuracy": 0.8501173268223918, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.6865, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1860 + }, + { + "entropy": 0.3168198253959417, + "epoch": 4.677459526774595, + "grad_norm": 0.9512342214584351, + "learning_rate": 0.0001453061146267775, + "loss": 0.23832404613494873, + "mean_token_accuracy": 0.9197044663131237, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3845940856912801, + "eval_loss": 0.606762707233429, + "eval_mean_token_accuracy": 0.8504838194957999, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.5175, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 1880 + }, + { + "entropy": 0.30791807882487776, + "epoch": 4.7272727272727275, + "grad_norm": 0.8123113512992859, + "learning_rate": 0.00014341760442398248, + "loss": 0.2395785331726074, + "mean_token_accuracy": 0.918928150832653, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.39762327222283494, + "eval_loss": 0.5994202494621277, + "eval_mean_token_accuracy": 0.8509274201337681, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.2873, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.993, + "step": 1900 + }, + { + "entropy": 0.3021434534341097, + "epoch": 4.777085927770859, + "grad_norm": 0.731787383556366, + "learning_rate": 0.000141519962826766, + "loss": 0.23494718074798585, + "mean_token_accuracy": 0.9201403826475143, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.3827026732439219, + "eval_loss": 0.5995895862579346, + "eval_mean_token_accuracy": 0.851468373523202, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.3006, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 1920 + }, + { + "entropy": 0.31626159623265265, + "epoch": 4.826899128268991, + "grad_norm": 0.8848487138748169, + "learning_rate": 0.00013961376213795132, + "loss": 0.2439030647277832, + "mean_token_accuracy": 0.9196575872600079, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.388698436839636, + "eval_loss": 0.6000174283981323, + "eval_mean_token_accuracy": 0.8518068187458571, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.8979, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.979, + "step": 1940 + }, + { + "entropy": 0.30520407035946845, + "epoch": 4.876712328767123, + "grad_norm": 0.8532460927963257, + "learning_rate": 0.00013769957724166695, + "loss": 0.23458616733551024, + "mean_token_accuracy": 0.9221912942826748, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.38777847102908203, + "eval_loss": 0.6004981398582458, + "eval_mean_token_accuracy": 0.8516481768253238, + "eval_num_tokens": 4578167.0, + "eval_runtime": 87.0777, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.975, + "step": 1960 + }, + { + "entropy": 0.3226448342204094, + "epoch": 4.926525529265255, + "grad_norm": 0.6945561766624451, + "learning_rate": 0.0001357779854299694, + "loss": 0.24048397541046143, + "mean_token_accuracy": 0.9195300146937371, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.38581624263247777, + "eval_loss": 0.6029234528541565, + "eval_mean_token_accuracy": 0.8514213260523108, + "eval_num_tokens": 4622316.0, + "eval_runtime": 85.8729, + "eval_samples_per_second": 16.012, + "eval_steps_per_second": 2.003, + "step": 1980 + }, + { + "entropy": 0.3051655298098922, + "epoch": 4.976338729763388, + "grad_norm": 0.7976452708244324, + "learning_rate": 0.00013384956622874001, + "loss": 0.23584742546081544, + "mean_token_accuracy": 0.9216851457953453, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.37913159246361533, + "eval_loss": 0.6057604551315308, + "eval_mean_token_accuracy": 0.8525801203971686, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.1145, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 2000 + }, + { + "entropy": 0.27438195240803254, + "epoch": 5.024906600249066, + "grad_norm": 0.6729586124420166, + "learning_rate": 0.0001319149012229075, + "loss": 0.19775952100753785, + "mean_token_accuracy": 0.9339428559327737, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.3448961910813354, + "eval_loss": 0.6750120520591736, + "eval_mean_token_accuracy": 0.8487970232963562, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.1169, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 2020 + }, + { + "entropy": 0.21423916313797237, + "epoch": 5.074719800747198, + "grad_norm": 0.6934391856193542, + "learning_rate": 0.00012997457388105022, + "loss": 0.1439570426940918, + "mean_token_accuracy": 0.9528236843645572, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.3570949243771475, + "eval_loss": 0.6465504169464111, + "eval_mean_token_accuracy": 0.8490785547467166, + "eval_num_tokens": 4763269.0, + "eval_runtime": 85.9574, + "eval_samples_per_second": 15.996, + "eval_steps_per_second": 2.001, + "step": 2040 + }, + { + "entropy": 0.20838565267622472, + "epoch": 5.12453300124533, + "grad_norm": 0.7286986112594604, + "learning_rate": 0.00012802916937942972, + "loss": 0.14467307329177856, + "mean_token_accuracy": 0.950994835793972, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.3452463157821533, + "eval_loss": 0.6705958843231201, + "eval_mean_token_accuracy": 0.8490352796953778, + "eval_num_tokens": 4809047.0, + "eval_runtime": 86.228, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 2060 + }, + { + "entropy": 0.20453082229942082, + "epoch": 5.174346201743462, + "grad_norm": 0.7515555620193481, + "learning_rate": 0.00012607927442550974, + "loss": 0.13732000589370727, + "mean_token_accuracy": 0.9537357829511166, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.32431264914745506, + "eval_loss": 0.6743043065071106, + "eval_mean_token_accuracy": 0.8504878629085629, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.5948, + "eval_samples_per_second": 15.879, + "eval_steps_per_second": 1.986, + "step": 2080 + }, + { + "entropy": 0.21812320686876774, + "epoch": 5.224159402241594, + "grad_norm": 0.9093465209007263, + "learning_rate": 0.0001241254770810132, + "loss": 0.14311420917510986, + "mean_token_accuracy": 0.9514068141579628, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.33086285835435225, + "eval_loss": 0.6676449179649353, + "eval_mean_token_accuracy": 0.8505287662495015, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 2100 + }, + { + "entropy": 0.2180163251236081, + "epoch": 5.273972602739726, + "grad_norm": 0.6703007221221924, + "learning_rate": 0.00012216836658457075, + "loss": 0.14803968667984008, + "mean_token_accuracy": 0.9521303348243236, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.33162341708707255, + "eval_loss": 0.6658875942230225, + "eval_mean_token_accuracy": 0.8500757605530495, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.6296, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 2120 + }, + { + "entropy": 0.22511130161583423, + "epoch": 5.323785803237858, + "grad_norm": 0.8078880906105042, + "learning_rate": 0.00012020853317401455, + "loss": 0.15228408575057983, + "mean_token_accuracy": 0.947144789993763, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3354601170434508, + "eval_loss": 0.6677829623222351, + "eval_mean_token_accuracy": 0.8482600024273229, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.4689, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.989, + "step": 2140 + }, + { + "entropy": 0.2244176059961319, + "epoch": 5.37359900373599, + "grad_norm": 0.9636075496673584, + "learning_rate": 0.00011824656790837037, + "loss": 0.15260883569717407, + "mean_token_accuracy": 0.9471467643976211, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.3381616926297199, + "eval_loss": 0.6694412231445312, + "eval_mean_token_accuracy": 0.8482369603805764, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.4147, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 2160 + }, + { + "entropy": 0.22982364390045404, + "epoch": 5.423412204234122, + "grad_norm": 0.775401771068573, + "learning_rate": 0.00011628306248960262, + "loss": 0.15140302181243898, + "mean_token_accuracy": 0.9492553934454918, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.3305150235808173, + "eval_loss": 0.6717822551727295, + "eval_mean_token_accuracy": 0.8489849723355715, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.4728, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.989, + "step": 2180 + }, + { + "entropy": 0.21448935717344284, + "epoch": 5.473225404732254, + "grad_norm": 0.6575281023979187, + "learning_rate": 0.00011431860908416465, + "loss": 0.1452319622039795, + "mean_token_accuracy": 0.9505287684500218, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3488145174328671, + "eval_loss": 0.6612305641174316, + "eval_mean_token_accuracy": 0.8492907808963642, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6927, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 2200 + }, + { + "entropy": 0.23091202937066554, + "epoch": 5.523038605230386, + "grad_norm": 0.8909686207771301, + "learning_rate": 0.00011235380014440985, + "loss": 0.15150139331817628, + "mean_token_accuracy": 0.9497875183820724, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.3268539015810157, + "eval_loss": 0.6667542457580566, + "eval_mean_token_accuracy": 0.8499062903398691, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.4644, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 2220 + }, + { + "entropy": 0.2227974807843566, + "epoch": 5.572851805728518, + "grad_norm": 0.6180275082588196, + "learning_rate": 0.0001103892282299158, + "loss": 0.1491069197654724, + "mean_token_accuracy": 0.9488144010305405, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3346347655494546, + "eval_loss": 0.6665948629379272, + "eval_mean_token_accuracy": 0.8499961893918903, + "eval_num_tokens": 5226864.0, + "eval_runtime": 87.0548, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.976, + "step": 2240 + }, + { + "entropy": 0.21368421968072654, + "epoch": 5.62266500622665, + "grad_norm": 0.6004369258880615, + "learning_rate": 0.00010842548582877651, + "loss": 0.14485255479812623, + "mean_token_accuracy": 0.9502056457102299, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.32753298804163933, + "eval_loss": 0.6680151224136353, + "eval_mean_token_accuracy": 0.8515451086121936, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.8524, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.98, + "step": 2260 + }, + { + "entropy": 0.2103635374456644, + "epoch": 5.672478206724782, + "grad_norm": 0.699174702167511, + "learning_rate": 0.00010646316517891613, + "loss": 0.14297772645950318, + "mean_token_accuracy": 0.9512537539005279, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.32966585959806, + "eval_loss": 0.675578773021698, + "eval_mean_token_accuracy": 0.8509623023659684, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.4518, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.99, + "step": 2280 + }, + { + "entropy": 0.22516900151968003, + "epoch": 5.722291407222914, + "grad_norm": 0.6637354493141174, + "learning_rate": 0.00010450285808947797, + "loss": 0.15202572345733642, + "mean_token_accuracy": 0.9482452072203159, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3369456917740578, + "eval_loss": 0.6697061061859131, + "eval_mean_token_accuracy": 0.848603522361711, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.6371, + "eval_samples_per_second": 15.871, + "eval_steps_per_second": 1.985, + "step": 2300 + }, + { + "entropy": 0.21841065725311637, + "epoch": 5.772104607721046, + "grad_norm": 0.7940268516540527, + "learning_rate": 0.00010254515576234297, + "loss": 0.14710167646408082, + "mean_token_accuracy": 0.9493498183786869, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3237486180177955, + "eval_loss": 0.6779657602310181, + "eval_mean_token_accuracy": 0.8500715313955794, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.1826, + "eval_samples_per_second": 15.954, + "eval_steps_per_second": 1.996, + "step": 2320 + }, + { + "entropy": 0.22146204356104135, + "epoch": 5.821917808219178, + "grad_norm": 0.9234833121299744, + "learning_rate": 0.00010059064861383132, + "loss": 0.14720046520233154, + "mean_token_accuracy": 0.9493872679769992, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.32365207564692167, + "eval_loss": 0.6704005002975464, + "eval_mean_token_accuracy": 0.8507985760306203, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.5494, + "eval_samples_per_second": 15.887, + "eval_steps_per_second": 1.987, + "step": 2340 + }, + { + "entropy": 0.20934011954814197, + "epoch": 5.87173100871731, + "grad_norm": 0.5547503232955933, + "learning_rate": 9.863992609664084e-05, + "loss": 0.1464867353439331, + "mean_token_accuracy": 0.9503875687718392, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.3330401429083458, + "eval_loss": 0.6659091114997864, + "eval_mean_token_accuracy": 0.8504848906467127, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.5855, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 2360 + }, + { + "entropy": 0.21678635366261007, + "epoch": 5.921544209215442, + "grad_norm": 0.570612907409668, + "learning_rate": 9.669357652207635e-05, + "loss": 0.14821385145187377, + "mean_token_accuracy": 0.9503940217196941, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3322022325077722, + "eval_loss": 0.6722489595413208, + "eval_mean_token_accuracy": 0.8489979422369669, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.2986, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 2380 + }, + { + "entropy": 0.20932920072227718, + "epoch": 5.971357409713574, + "grad_norm": 0.7879557609558105, + "learning_rate": 9.475218688262262e-05, + "loss": 0.14675841331481934, + "mean_token_accuracy": 0.9507176131010056, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.3199348642902319, + "eval_loss": 0.6698136329650879, + "eval_mean_token_accuracy": 0.8514142130003419, + "eval_num_tokens": 5605400.0, + "eval_runtime": 85.8995, + "eval_samples_per_second": 16.007, + "eval_steps_per_second": 2.002, + "step": 2400 + }, + { + "entropy": 0.21032143919131693, + "epoch": 6.019925280199253, + "grad_norm": 0.5823076367378235, + "learning_rate": 9.281634267491569e-05, + "loss": 0.13322267532348633, + "mean_token_accuracy": 0.9550939072401096, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.30206270117399303, + "eval_loss": 0.7093168497085571, + "eval_mean_token_accuracy": 0.8500627639681794, + "eval_num_tokens": 5648968.0, + "eval_runtime": 85.8128, + "eval_samples_per_second": 16.023, + "eval_steps_per_second": 2.004, + "step": 2420 + }, + { + "entropy": 0.1534628233872354, + "epoch": 6.069738480697385, + "grad_norm": 0.710133969783783, + "learning_rate": 9.088662772316508e-05, + "loss": 0.09078952670097351, + "mean_token_accuracy": 0.9678447999060154, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.28208133101809857, + "eval_loss": 0.7636417150497437, + "eval_mean_token_accuracy": 0.8494061477655588, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9724, + "eval_samples_per_second": 15.994, + "eval_steps_per_second": 2.001, + "step": 2440 + }, + { + "entropy": 0.16151462448760867, + "epoch": 6.119551681195516, + "grad_norm": 0.5793812274932861, + "learning_rate": 8.896362400308028e-05, + "loss": 0.09545697569847107, + "mean_token_accuracy": 0.9671573750674725, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.2833245605403601, + "eval_loss": 0.7402405738830566, + "eval_mean_token_accuracy": 0.8503523728875226, + "eval_num_tokens": 5745090.0, + "eval_runtime": 85.5461, + "eval_samples_per_second": 16.073, + "eval_steps_per_second": 2.011, + "step": 2460 + }, + { + "entropy": 0.15203177919611335, + "epoch": 6.169364881693649, + "grad_norm": 0.4251123368740082, + "learning_rate": 8.704791146635483e-05, + "loss": 0.09420782327651978, + "mean_token_accuracy": 0.9677386932075024, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.28572545962971313, + "eval_loss": 0.735416829586029, + "eval_mean_token_accuracy": 0.8487084663884584, + "eval_num_tokens": 5790333.0, + "eval_runtime": 85.4801, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.012, + "step": 2480 + }, + { + "entropy": 0.15587336672469973, + "epoch": 6.219178082191781, + "grad_norm": 0.4357028007507324, + "learning_rate": 8.514006786576085e-05, + "loss": 0.09429320096969604, + "mean_token_accuracy": 0.9682952925562859, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.2859006894882335, + "eval_loss": 0.7347224950790405, + "eval_mean_token_accuracy": 0.8501905518215757, + "eval_num_tokens": 5837321.0, + "eval_runtime": 85.7578, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.006, + "step": 2500 + }, + { + "entropy": 0.15765639198943973, + "epoch": 6.268991282689913, + "grad_norm": 0.47331130504608154, + "learning_rate": 8.324066858090663e-05, + "loss": 0.09571113586425781, + "mean_token_accuracy": 0.9683481335639954, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.29231513846059176, + "eval_loss": 0.7392512559890747, + "eval_mean_token_accuracy": 0.8486633983462356, + "eval_num_tokens": 5884398.0, + "eval_runtime": 85.7846, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.005, + "step": 2520 + }, + { + "entropy": 0.16176860257983208, + "epoch": 6.318804483188045, + "grad_norm": 0.6142018437385559, + "learning_rate": 8.135028644470992e-05, + "loss": 0.09486144185066223, + "mean_token_accuracy": 0.9682316601276397, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.2851274753379267, + "eval_loss": 0.7520816922187805, + "eval_mean_token_accuracy": 0.8501113649717597, + "eval_num_tokens": 5929876.0, + "eval_runtime": 85.9425, + "eval_samples_per_second": 15.999, + "eval_steps_per_second": 2.001, + "step": 2540 + }, + { + "entropy": 0.15404034564271568, + "epoch": 6.3686176836861765, + "grad_norm": 0.6051287651062012, + "learning_rate": 7.946949157063964e-05, + "loss": 0.09280472993850708, + "mean_token_accuracy": 0.9684635892510414, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28802703563557114, + "eval_loss": 0.7439162135124207, + "eval_mean_token_accuracy": 0.8499851770872293, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.0703, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.998, + "step": 2560 + }, + { + "entropy": 0.15343588953837753, + "epoch": 6.418430884184309, + "grad_norm": 0.4823743402957916, + "learning_rate": 7.759885118077701e-05, + "loss": 0.09000591039657593, + "mean_token_accuracy": 0.9699928767979145, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2795634938533916, + "eval_loss": 0.7647850513458252, + "eval_mean_token_accuracy": 0.8503464397995971, + "eval_num_tokens": 6025380.0, + "eval_runtime": 85.8886, + "eval_samples_per_second": 16.009, + "eval_steps_per_second": 2.003, + "step": 2580 + }, + { + "entropy": 0.15740026142448188, + "epoch": 6.468244084682441, + "grad_norm": 0.5082696676254272, + "learning_rate": 7.57389294347494e-05, + "loss": 0.09191849827766418, + "mean_token_accuracy": 0.9692809768021107, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2913342311458532, + "eval_loss": 0.7518694996833801, + "eval_mean_token_accuracy": 0.8483168302580367, + "eval_num_tokens": 6073349.0, + "eval_runtime": 85.5761, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.01, + "step": 2600 + }, + { + "entropy": 0.15922069251537324, + "epoch": 6.518057285180573, + "grad_norm": 0.3995199501514435, + "learning_rate": 7.389028725958736e-05, + "loss": 0.09584367871284485, + "mean_token_accuracy": 0.9685114495456218, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.2863075934177221, + "eval_loss": 0.7539381384849548, + "eval_mean_token_accuracy": 0.8507507083027862, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.112, + "eval_samples_per_second": 15.968, + "eval_steps_per_second": 1.997, + "step": 2620 + }, + { + "entropy": 0.16197575423866512, + "epoch": 6.567870485678705, + "grad_norm": 0.534295380115509, + "learning_rate": 7.205348218055678e-05, + "loss": 0.0961170256137848, + "mean_token_accuracy": 0.9674530044198036, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.29021967315050057, + "eval_loss": 0.751198947429657, + "eval_mean_token_accuracy": 0.8509796344956686, + "eval_num_tokens": 6165523.0, + "eval_runtime": 85.7958, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.005, + "step": 2640 + }, + { + "entropy": 0.15261746793985367, + "epoch": 6.617683686176837, + "grad_norm": 0.5391237139701843, + "learning_rate": 7.022906815301673e-05, + "loss": 0.0926026999950409, + "mean_token_accuracy": 0.9695659473538398, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.29128045216202736, + "eval_loss": 0.7450292110443115, + "eval_mean_token_accuracy": 0.8498771443616512, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.3963, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 2660 + }, + { + "entropy": 0.16164180357009172, + "epoch": 6.667496886674969, + "grad_norm": 0.5767946243286133, + "learning_rate": 6.841759539535419e-05, + "loss": 0.09291981458663941, + "mean_token_accuracy": 0.9687136687338352, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2897637223088464, + "eval_loss": 0.7503410577774048, + "eval_mean_token_accuracy": 0.8503315164599308, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.0653, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.998, + "step": 2680 + }, + { + "entropy": 0.17062523355707526, + "epoch": 6.717310087173101, + "grad_norm": 0.4974168539047241, + "learning_rate": 6.661961022304563e-05, + "loss": 0.09713236689567566, + "mean_token_accuracy": 0.9661971725523472, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2765843396963075, + "eval_loss": 0.7604002356529236, + "eval_mean_token_accuracy": 0.8521115277395692, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.1676, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 2700 + }, + { + "entropy": 0.17544092936441302, + "epoch": 6.767123287671232, + "grad_norm": 0.5523537993431091, + "learning_rate": 6.483565488389582e-05, + "loss": 0.09709116220474243, + "mean_token_accuracy": 0.9650957375764847, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.27939334659035814, + "eval_loss": 0.7534670829772949, + "eval_mean_token_accuracy": 0.851230604010959, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.2913, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 2720 + }, + { + "entropy": 0.15991022661328316, + "epoch": 6.816936488169365, + "grad_norm": 0.478551983833313, + "learning_rate": 6.306626739450311e-05, + "loss": 0.09564646482467651, + "mean_token_accuracy": 0.9679084822535515, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.27878295491601146, + "eval_loss": 0.7519959211349487, + "eval_mean_token_accuracy": 0.8510654949864676, + "eval_num_tokens": 6397720.0, + "eval_runtime": 85.9109, + "eval_samples_per_second": 16.005, + "eval_steps_per_second": 2.002, + "step": 2740 + }, + { + "entropy": 0.16824879590421915, + "epoch": 6.866749688667497, + "grad_norm": 0.6681098937988281, + "learning_rate": 6.131198137800108e-05, + "loss": 0.0962279736995697, + "mean_token_accuracy": 0.966830012947321, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.2834690434121808, + "eval_loss": 0.751922070980072, + "eval_mean_token_accuracy": 0.8521237577809844, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.3618, + "eval_samples_per_second": 15.921, + "eval_steps_per_second": 1.992, + "step": 2760 + }, + { + "entropy": 0.1518704930320382, + "epoch": 6.916562889165629, + "grad_norm": 0.5201290249824524, + "learning_rate": 5.957332590312513e-05, + "loss": 0.09010660648345947, + "mean_token_accuracy": 0.9693463340401649, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.28485129617674404, + "eval_loss": 0.7452457547187805, + "eval_mean_token_accuracy": 0.8512036796919135, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.4524, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.99, + "step": 2780 + }, + { + "entropy": 0.15512610590085388, + "epoch": 6.966376089663761, + "grad_norm": 0.42802050709724426, + "learning_rate": 5.785082532465233e-05, + "loss": 0.09320432543754578, + "mean_token_accuracy": 0.9686134628951549, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.27554594526110693, + "eval_loss": 0.7644653916358948, + "eval_mean_token_accuracy": 0.8513738523389018, + "eval_num_tokens": 6540175.0, + "eval_runtime": 85.7609, + "eval_samples_per_second": 16.033, + "eval_steps_per_second": 2.006, + "step": 2800 + }, + { + "entropy": 0.17524497526196334, + "epoch": 7.01494396014944, + "grad_norm": 0.3330269157886505, + "learning_rate": 5.6144999125263545e-05, + "loss": 0.0895616888999939, + "mean_token_accuracy": 0.9682766932707566, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.2735865569218647, + "eval_loss": 0.768479585647583, + "eval_mean_token_accuracy": 0.8503459383581959, + "eval_num_tokens": 6583767.0, + "eval_runtime": 85.7162, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.007, + "step": 2820 + }, + { + "entropy": 0.1403565663844347, + "epoch": 7.064757160647572, + "grad_norm": 0.35613498091697693, + "learning_rate": 5.4456361758874235e-05, + "loss": 0.07551313638687134, + "mean_token_accuracy": 0.9739301167428493, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.25941789089593775, + "eval_loss": 0.8209511637687683, + "eval_mean_token_accuracy": 0.8505055855873019, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.0943, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 2840 + }, + { + "entropy": 0.13500106502324344, + "epoch": 7.114570361145703, + "grad_norm": 0.34418627619743347, + "learning_rate": 5.2785422495482234e-05, + "loss": 0.07293946146965027, + "mean_token_accuracy": 0.9747208289802074, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.26482899772912954, + "eval_loss": 0.798904538154602, + "eval_mean_token_accuracy": 0.8511530233677044, + "eval_num_tokens": 6672946.0, + "eval_runtime": 85.7915, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.005, + "step": 2860 + }, + { + "entropy": 0.13127502552233636, + "epoch": 7.164383561643835, + "grad_norm": 0.4638441503047943, + "learning_rate": 5.113268526757892e-05, + "loss": 0.07121461629867554, + "mean_token_accuracy": 0.9756786689162255, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2645381211714689, + "eval_loss": 0.809101939201355, + "eval_mean_token_accuracy": 0.8514727898115335, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.84, + "eval_samples_per_second": 16.018, + "eval_steps_per_second": 2.004, + "step": 2880 + }, + { + "entropy": 0.1331390908919275, + "epoch": 7.214196762141968, + "grad_norm": 0.40206775069236755, + "learning_rate": 4.949864851817007e-05, + "loss": 0.07188264131546021, + "mean_token_accuracy": 0.9755406074225903, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.26244733283339544, + "eval_loss": 0.8143188953399658, + "eval_mean_token_accuracy": 0.8514358189909957, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.8546, + "eval_samples_per_second": 16.015, + "eval_steps_per_second": 2.003, + "step": 2900 + }, + { + "entropy": 0.13647331558167936, + "epoch": 7.2640099626401, + "grad_norm": 0.26405787467956543, + "learning_rate": 4.788380505045224e-05, + "loss": 0.07412450313568116, + "mean_token_accuracy": 0.9744274213910102, + "num_tokens": 6809678.0, + "step": 2920 + }, + { + "epoch": 7.2640099626401, + "eval_entropy": 0.2626111418182074, + "eval_loss": 0.8111525177955627, + "eval_mean_token_accuracy": 0.8512121695418691, + "eval_num_tokens": 6809678.0, + "eval_runtime": 85.9626, + "eval_samples_per_second": 15.995, + "eval_steps_per_second": 2.001, + "step": 2920 + }, + { + "entropy": 0.12644002586603165, + "epoch": 7.313823163138232, + "grad_norm": 0.27514681220054626, + "learning_rate": 4.6288641879189884e-05, + "loss": 0.06807711124420165, + "mean_token_accuracy": 0.9760703906416893, + "num_tokens": 6860750.0, + "step": 2940 + }, + { + "epoch": 7.313823163138232, + "eval_entropy": 0.26096762734097106, + "eval_loss": 0.8184595108032227, + "eval_mean_token_accuracy": 0.8501476153384807, + "eval_num_tokens": 6860750.0, + "eval_runtime": 85.9521, + "eval_samples_per_second": 15.997, + "eval_steps_per_second": 2.001, + "step": 2940 + }, + { + "entropy": 0.13920630998909472, + "epoch": 7.363636363636363, + "grad_norm": 0.23584705591201782, + "learning_rate": 4.4713640083838604e-05, + "loss": 0.07301607131958007, + "mean_token_accuracy": 0.9745715200901032, + "num_tokens": 6907092.0, + "step": 2960 + }, + { + "epoch": 7.363636363636363, + "eval_entropy": 0.2612536767021168, + "eval_loss": 0.8116245269775391, + "eval_mean_token_accuracy": 0.8510967350976412, + "eval_num_tokens": 6907092.0, + "eval_runtime": 85.6373, + "eval_samples_per_second": 16.056, + "eval_steps_per_second": 2.008, + "step": 2960 + }, + { + "entropy": 0.1349492883309722, + "epoch": 7.4134495641344955, + "grad_norm": 0.24552719295024872, + "learning_rate": 4.315927466345791e-05, + "loss": 0.07397544980049134, + "mean_token_accuracy": 0.9745095103979111, + "num_tokens": 6952700.0, + "step": 2980 + }, + { + "epoch": 7.4134495641344955, + "eval_entropy": 0.25796533306670744, + "eval_loss": 0.8266491293907166, + "eval_mean_token_accuracy": 0.8511653857868772, + "eval_num_tokens": 6952700.0, + "eval_runtime": 85.7462, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.006, + "step": 2980 + }, + { + "entropy": 0.14479175000451505, + "epoch": 7.463262764632628, + "grad_norm": 0.2846072018146515, + "learning_rate": 4.162601439345814e-05, + "loss": 0.07544798254966736, + "mean_token_accuracy": 0.9727819666266442, + "num_tokens": 6996430.0, + "step": 3000 + }, + { + "epoch": 7.463262764632628, + "eval_entropy": 0.2584348309698493, + "eval_loss": 0.8253348469734192, + "eval_mean_token_accuracy": 0.8511569815319638, + "eval_num_tokens": 6996430.0, + "eval_runtime": 86.2984, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 3000 + }, + { + "entropy": 0.14114196319133043, + "epoch": 7.51307596513076, + "grad_norm": 0.407966285943985, + "learning_rate": 4.011432168422419e-05, + "loss": 0.0736398994922638, + "mean_token_accuracy": 0.9741654269397259, + "num_tokens": 7042038.0, + "step": 3020 + }, + { + "epoch": 7.51307596513076, + "eval_entropy": 0.25232676260693127, + "eval_loss": 0.8296052813529968, + "eval_mean_token_accuracy": 0.8523298349491385, + "eval_num_tokens": 7042038.0, + "eval_runtime": 85.8445, + "eval_samples_per_second": 16.017, + "eval_steps_per_second": 2.004, + "step": 3020 + }, + { + "entropy": 0.1353456223383546, + "epoch": 7.562889165628892, + "grad_norm": 0.2712634801864624, + "learning_rate": 3.8624652441658684e-05, + "loss": 0.07362412214279175, + "mean_token_accuracy": 0.9747945807874203, + "num_tokens": 7089390.0, + "step": 3040 + }, + { + "epoch": 7.562889165628892, + "eval_entropy": 0.2579477243991785, + "eval_loss": 0.8274564743041992, + "eval_mean_token_accuracy": 0.8517705212498821, + "eval_num_tokens": 7089390.0, + "eval_runtime": 85.8222, + "eval_samples_per_second": 16.022, + "eval_steps_per_second": 2.004, + "step": 3040 + }, + { + "entropy": 0.1296080862637609, + "epoch": 7.6127023661270234, + "grad_norm": 0.2371893972158432, + "learning_rate": 3.715745592968707e-05, + "loss": 0.06971035599708557, + "mean_token_accuracy": 0.9759043246507645, + "num_tokens": 7138002.0, + "step": 3060 + }, + { + "epoch": 7.6127023661270234, + "eval_entropy": 0.25391967083479083, + "eval_loss": 0.8197130560874939, + "eval_mean_token_accuracy": 0.8522267875283264, + "eval_num_tokens": 7138002.0, + "eval_runtime": 85.8796, + "eval_samples_per_second": 16.011, + "eval_steps_per_second": 2.003, + "step": 3060 + }, + { + "entropy": 0.1311203008517623, + "epoch": 7.662515566625156, + "grad_norm": 0.22499267756938934, + "learning_rate": 3.5713174634765967e-05, + "loss": 0.07176244258880615, + "mean_token_accuracy": 0.9754939571022987, + "num_tokens": 7185520.0, + "step": 3080 + }, + { + "epoch": 7.662515566625156, + "eval_entropy": 0.2526215241225653, + "eval_loss": 0.8265154361724854, + "eval_mean_token_accuracy": 0.8519952584837758, + "eval_num_tokens": 7185520.0, + "eval_runtime": 85.8746, + "eval_samples_per_second": 16.012, + "eval_steps_per_second": 2.003, + "step": 3080 + }, + { + "entropy": 0.13420484317466616, + "epoch": 7.712328767123288, + "grad_norm": 0.2398064285516739, + "learning_rate": 3.4292244132434866e-05, + "loss": 0.07559212446212768, + "mean_token_accuracy": 0.9743142127990723, + "num_tokens": 7232170.0, + "step": 3100 + }, + { + "epoch": 7.712328767123288, + "eval_entropy": 0.2484562756537005, + "eval_loss": 0.8312150239944458, + "eval_mean_token_accuracy": 0.8528405119513356, + "eval_num_tokens": 7232170.0, + "eval_runtime": 85.7896, + "eval_samples_per_second": 16.028, + "eval_steps_per_second": 2.005, + "step": 3100 + }, + { + "entropy": 0.11965563679113984, + "epoch": 7.76214196762142, + "grad_norm": 0.3408384919166565, + "learning_rate": 3.2895092955952746e-05, + "loss": 0.0661750853061676, + "mean_token_accuracy": 0.9776600524783134, + "num_tokens": 7282846.0, + "step": 3120 + }, + { + "epoch": 7.76214196762142, + "eval_entropy": 0.2522421533804993, + "eval_loss": 0.8327009677886963, + "eval_mean_token_accuracy": 0.8524222023958383, + "eval_num_tokens": 7282846.0, + "eval_runtime": 86.1769, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 1.996, + "step": 3120 + }, + { + "entropy": 0.13388084415346385, + "epoch": 7.811955168119551, + "grad_norm": 0.35418516397476196, + "learning_rate": 3.152214246705829e-05, + "loss": 0.07149899601936341, + "mean_token_accuracy": 0.9747635535895824, + "num_tokens": 7331518.0, + "step": 3140 + }, + { + "epoch": 7.811955168119551, + "eval_entropy": 0.25038352296795957, + "eval_loss": 0.836457371711731, + "eval_mean_token_accuracy": 0.8526130665180295, + "eval_num_tokens": 7331518.0, + "eval_runtime": 85.6099, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.009, + "step": 3140 + }, + { + "entropy": 0.13530643959529698, + "epoch": 7.861768368617684, + "grad_norm": 0.38060539960861206, + "learning_rate": 3.017380672889291e-05, + "loss": 0.07116585969924927, + "mean_token_accuracy": 0.973284512758255, + "num_tokens": 7379056.0, + "step": 3160 + }, + { + "epoch": 7.861768368617684, + "eval_entropy": 0.255092611319797, + "eval_loss": 0.8314701914787292, + "eval_mean_token_accuracy": 0.8520913099826768, + "eval_num_tokens": 7379056.0, + "eval_runtime": 85.877, + "eval_samples_per_second": 16.011, + "eval_steps_per_second": 2.003, + "step": 3160 + }, + { + "entropy": 0.13383390177041293, + "epoch": 7.911581569115816, + "grad_norm": 0.3827536106109619, + "learning_rate": 2.8850492381124808e-05, + "loss": 0.07305437326431274, + "mean_token_accuracy": 0.9750778004527092, + "num_tokens": 7424770.0, + "step": 3180 + }, + { + "epoch": 7.911581569115816, + "eval_entropy": 0.25416371157003004, + "eval_loss": 0.8206402063369751, + "eval_mean_token_accuracy": 0.852779901651449, + "eval_num_tokens": 7424770.0, + "eval_runtime": 86.1015, + "eval_samples_per_second": 15.97, + "eval_steps_per_second": 1.998, + "step": 3180 + }, + { + "entropy": 0.1395680439658463, + "epoch": 7.961394769613948, + "grad_norm": 0.3809775412082672, + "learning_rate": 2.7552598517312256e-05, + "loss": 0.07236042022705078, + "mean_token_accuracy": 0.9731538116931915, + "num_tokens": 7470804.0, + "step": 3200 + }, + { + "epoch": 7.961394769613948, + "eval_entropy": 0.25528111975899964, + "eval_loss": 0.8230037093162537, + "eval_mean_token_accuracy": 0.8526452603035195, + "eval_num_tokens": 7470804.0, + "eval_runtime": 85.7895, + "eval_samples_per_second": 16.028, + "eval_steps_per_second": 2.005, + "step": 3200 + }, + { + "entropy": 0.12193699864049752, + "epoch": 8.009962640099626, + "grad_norm": 0.11854425817728043, + "learning_rate": 2.6280516564542205e-05, + "loss": 0.06617764234542847, + "mean_token_accuracy": 0.977179691577569, + "num_tokens": 7518110.0, + "step": 3220 + }, + { + "epoch": 8.009962640099626, + "eval_entropy": 0.25100527677771656, + "eval_loss": 0.8393343687057495, + "eval_mean_token_accuracy": 0.8522553132023922, + "eval_num_tokens": 7518110.0, + "eval_runtime": 85.8837, + "eval_samples_per_second": 16.01, + "eval_steps_per_second": 2.003, + "step": 3220 + }, + { + "entropy": 0.12788885813206435, + "epoch": 8.059775840597759, + "grad_norm": 0.16094881296157837, + "learning_rate": 2.50346301653812e-05, + "loss": 0.06274186968803405, + "mean_token_accuracy": 0.9766994707286358, + "num_tokens": 7565539.0, + "step": 3240 + }, + { + "epoch": 8.059775840597759, + "eval_entropy": 0.24409458682287571, + "eval_loss": 0.874617338180542, + "eval_mean_token_accuracy": 0.8521041180505309, + "eval_num_tokens": 7565539.0, + "eval_runtime": 86.2656, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 3240 + }, + { + "entropy": 0.12464155335910618, + "epoch": 8.10958904109589, + "grad_norm": 0.16893954575061798, + "learning_rate": 2.381531506217437e-05, + "loss": 0.06093020439147949, + "mean_token_accuracy": 0.9776258453726768, + "num_tokens": 7612578.0, + "step": 3260 + }, + { + "epoch": 8.10958904109589, + "eval_entropy": 0.24396493017326953, + "eval_loss": 0.891161322593689, + "eval_mean_token_accuracy": 0.8515338024427724, + "eval_num_tokens": 7612578.0, + "eval_runtime": 85.9061, + "eval_samples_per_second": 16.006, + "eval_steps_per_second": 2.002, + "step": 3260 + }, + { + "entropy": 0.12345920228399336, + "epoch": 8.159402241594023, + "grad_norm": 0.14332273602485657, + "learning_rate": 2.262293898372616e-05, + "loss": 0.061289966106414795, + "mean_token_accuracy": 0.9762230902910233, + "num_tokens": 7660157.0, + "step": 3280 + }, + { + "epoch": 8.159402241594023, + "eval_entropy": 0.2481445314059424, + "eval_loss": 0.8922848105430603, + "eval_mean_token_accuracy": 0.8514944855556932, + "eval_num_tokens": 7660157.0, + "eval_runtime": 85.5201, + "eval_samples_per_second": 16.078, + "eval_steps_per_second": 2.011, + "step": 3280 + }, + { + "entropy": 0.12298110066913068, + "epoch": 8.209215442092155, + "grad_norm": 0.21848882734775543, + "learning_rate": 2.1457861534398633e-05, + "loss": 0.05986443758010864, + "mean_token_accuracy": 0.9786281704902648, + "num_tokens": 7709745.0, + "step": 3300 + }, + { + "epoch": 8.209215442092155, + "eval_entropy": 0.24329388124305149, + "eval_loss": 0.9021085500717163, + "eval_mean_token_accuracy": 0.8521762625422589, + "eval_num_tokens": 7709745.0, + "eval_runtime": 85.955, + "eval_samples_per_second": 15.997, + "eval_steps_per_second": 2.001, + "step": 3300 + }, + { + "entropy": 0.13265180448070168, + "epoch": 8.259028642590286, + "grad_norm": 0.18067947030067444, + "learning_rate": 2.0320434085659692e-05, + "loss": 0.06724961400032044, + "mean_token_accuracy": 0.975098168104887, + "num_tokens": 7753571.0, + "step": 3320 + }, + { + "epoch": 8.259028642590286, + "eval_entropy": 0.2433211464694766, + "eval_loss": 0.9094350337982178, + "eval_mean_token_accuracy": 0.8520150094531304, + "eval_num_tokens": 7753571.0, + "eval_runtime": 85.7989, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.005, + "step": 3320 + }, + { + "entropy": 0.11949320202693343, + "epoch": 8.308841843088418, + "grad_norm": 0.17020289599895477, + "learning_rate": 1.9210999670114196e-05, + "loss": 0.0634455680847168, + "mean_token_accuracy": 0.9771294385194779, + "num_tokens": 7799310.0, + "step": 3340 + }, + { + "epoch": 8.308841843088418, + "eval_entropy": 0.24345201219237128, + "eval_loss": 0.9021793603897095, + "eval_mean_token_accuracy": 0.8520745697409607, + "eval_num_tokens": 7799310.0, + "eval_runtime": 86.0883, + "eval_samples_per_second": 15.972, + "eval_steps_per_second": 1.998, + "step": 3340 + }, + { + "entropy": 0.12065747743472457, + "epoch": 8.35865504358655, + "grad_norm": 0.16789060831069946, + "learning_rate": 1.8129892878049886e-05, + "loss": 0.061494195461273195, + "mean_token_accuracy": 0.9779584899544715, + "num_tokens": 7846447.0, + "step": 3360 + }, + { + "epoch": 8.35865504358655, + "eval_entropy": 0.24093415042342142, + "eval_loss": 0.9006755352020264, + "eval_mean_token_accuracy": 0.852174230786257, + "eval_num_tokens": 7846447.0, + "eval_runtime": 85.9011, + "eval_samples_per_second": 16.007, + "eval_steps_per_second": 2.002, + "step": 3360 + }, + { + "entropy": 0.13125578537583352, + "epoch": 8.408468244084682, + "grad_norm": 0.1662452220916748, + "learning_rate": 1.70774397565298e-05, + "loss": 0.06685600876808166, + "mean_token_accuracy": 0.9744067586958408, + "num_tokens": 7890283.0, + "step": 3380 + }, + { + "epoch": 8.408468244084682, + "eval_entropy": 0.24062153688350388, + "eval_loss": 0.9078915119171143, + "eval_mean_token_accuracy": 0.8523201647886011, + "eval_num_tokens": 7890283.0, + "eval_runtime": 86.0201, + "eval_samples_per_second": 15.985, + "eval_steps_per_second": 2.0, + "step": 3380 + }, + { + "entropy": 0.11986117120832204, + "epoch": 8.458281444582815, + "grad_norm": 0.19571948051452637, + "learning_rate": 1.6053957711060606e-05, + "loss": 0.06411095261573792, + "mean_token_accuracy": 0.9770627245306969, + "num_tokens": 7936518.0, + "step": 3400 + }, + { + "epoch": 8.458281444582815, + "eval_entropy": 0.24352820347561394, + "eval_loss": 0.9058943390846252, + "eval_mean_token_accuracy": 0.8519382792156797, + "eval_num_tokens": 7936518.0, + "eval_runtime": 85.966, + "eval_samples_per_second": 15.995, + "eval_steps_per_second": 2.001, + "step": 3400 + }, + { + "entropy": 0.12857897616922856, + "epoch": 8.508094645080947, + "grad_norm": 0.2609264850616455, + "learning_rate": 1.5059755409867613e-05, + "loss": 0.06473397612571716, + "mean_token_accuracy": 0.9764650195837021, + "num_tokens": 7981966.0, + "step": 3420 + }, + { + "epoch": 8.508094645080947, + "eval_entropy": 0.24032609000108962, + "eval_loss": 0.9077776074409485, + "eval_mean_token_accuracy": 0.8517829197090726, + "eval_num_tokens": 7981966.0, + "eval_runtime": 86.6059, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 3420 + }, + { + "entropy": 0.12348870886489749, + "epoch": 8.557907845579079, + "grad_norm": 0.19537609815597534, + "learning_rate": 1.409513269080473e-05, + "loss": 0.06481348872184753, + "mean_token_accuracy": 0.9769559659063816, + "num_tokens": 8028367.0, + "step": 3440 + }, + { + "epoch": 8.557907845579079, + "eval_entropy": 0.2404322574824788, + "eval_loss": 0.9057720899581909, + "eval_mean_token_accuracy": 0.8521037981953732, + "eval_num_tokens": 8028367.0, + "eval_runtime": 86.166, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.996, + "step": 3440 + }, + { + "entropy": 0.12040232736617326, + "epoch": 8.607721046077211, + "grad_norm": 0.3310582935810089, + "learning_rate": 1.3160380470927183e-05, + "loss": 0.06468871235847473, + "mean_token_accuracy": 0.9768650442361831, + "num_tokens": 8074934.0, + "step": 3460 + }, + { + "epoch": 8.607721046077211, + "eval_entropy": 0.24118655876711356, + "eval_loss": 0.9028318524360657, + "eval_mean_token_accuracy": 0.8521025340224422, + "eval_num_tokens": 8074934.0, + "eval_runtime": 85.3668, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.015, + "step": 3460 + }, + { + "entropy": 0.12328103906475008, + "epoch": 8.657534246575342, + "grad_norm": 0.12836167216300964, + "learning_rate": 1.2255780658755122e-05, + "loss": 0.06229386329650879, + "mean_token_accuracy": 0.9763277888298034, + "num_tokens": 8122775.0, + "step": 3480 + }, + { + "epoch": 8.657534246575342, + "eval_entropy": 0.24194598145956217, + "eval_loss": 0.9009329080581665, + "eval_mean_token_accuracy": 0.8521693289973015, + "eval_num_tokens": 8122775.0, + "eval_runtime": 85.9415, + "eval_samples_per_second": 15.999, + "eval_steps_per_second": 2.001, + "step": 3480 + }, + { + "entropy": 0.11321646976284683, + "epoch": 8.707347447073474, + "grad_norm": 0.15656894445419312, + "learning_rate": 1.1381606069253786e-05, + "loss": 0.05908188819885254, + "mean_token_accuracy": 0.9779504477977753, + "num_tokens": 8174307.0, + "step": 3500 + }, + { + "epoch": 8.707347447073474, + "eval_entropy": 0.24121542517528977, + "eval_loss": 0.9016091823577881, + "eval_mean_token_accuracy": 0.8521790667328724, + "eval_num_tokens": 8174307.0, + "eval_runtime": 85.7465, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.006, + "step": 3500 + }, + { + "entropy": 0.12657046681270004, + "epoch": 8.757160647571606, + "grad_norm": 0.22597502171993256, + "learning_rate": 1.053812034155629e-05, + "loss": 0.06244581937789917, + "mean_token_accuracy": 0.976795207709074, + "num_tokens": 8222808.0, + "step": 3520 + }, + { + "epoch": 8.757160647571606, + "eval_entropy": 0.23877542708502258, + "eval_loss": 0.9069110155105591, + "eval_mean_token_accuracy": 0.8522880177858264, + "eval_num_tokens": 8222808.0, + "eval_runtime": 85.7792, + "eval_samples_per_second": 16.03, + "eval_steps_per_second": 2.005, + "step": 3520 + }, + { + "entropy": 0.11422101808711886, + "epoch": 8.806973848069738, + "grad_norm": 0.21139323711395264, + "learning_rate": 9.725577859453502e-06, + "loss": 0.05988085865974426, + "mean_token_accuracy": 0.9779510758817196, + "num_tokens": 8273335.0, + "step": 3540 + }, + { + "epoch": 8.806973848069738, + "eval_entropy": 0.2393161087881687, + "eval_loss": 0.9033801555633545, + "eval_mean_token_accuracy": 0.8522614209457885, + "eval_num_tokens": 8273335.0, + "eval_runtime": 85.5594, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 3540 + }, + { + "entropy": 0.13810604228638113, + "epoch": 8.85678704856787, + "grad_norm": 0.24571993947029114, + "learning_rate": 8.944223674675537e-06, + "loss": 0.07036117911338806, + "mean_token_accuracy": 0.9734892748296261, + "num_tokens": 8315235.0, + "step": 3560 + }, + { + "epoch": 8.85678704856787, + "eval_entropy": 0.23998506947658782, + "eval_loss": 0.9009848833084106, + "eval_mean_token_accuracy": 0.8521793619837872, + "eval_num_tokens": 8315235.0, + "eval_runtime": 86.0974, + "eval_samples_per_second": 15.97, + "eval_steps_per_second": 1.998, + "step": 3560 + }, + { + "entropy": 0.14193559321574867, + "epoch": 8.906600249066003, + "grad_norm": 0.17304112017154694, + "learning_rate": 8.194293432987386e-06, + "loss": 0.07077967524528503, + "mean_token_accuracy": 0.973305893689394, + "num_tokens": 8358099.0, + "step": 3580 + }, + { + "epoch": 8.906600249066003, + "eval_entropy": 0.23883876689644748, + "eval_loss": 0.9015622138977051, + "eval_mean_token_accuracy": 0.8524864378363587, + "eval_num_tokens": 8358099.0, + "eval_runtime": 86.0089, + "eval_samples_per_second": 15.987, + "eval_steps_per_second": 2.0, + "step": 3580 + }, + { + "entropy": 0.11878943420015275, + "epoch": 8.956413449564135, + "grad_norm": 0.19075658917427063, + "learning_rate": 7.476013303121426e-06, + "loss": 0.060806107521057126, + "mean_token_accuracy": 0.9776863709092141, + "num_tokens": 8407430.0, + "step": 3600 + }, + { + "epoch": 8.956413449564135, + "eval_entropy": 0.23726526309931, + "eval_loss": 0.9060276746749878, + "eval_mean_token_accuracy": 0.8524192058762838, + "eval_num_tokens": 8407430.0, + "eval_runtime": 85.7252, + "eval_samples_per_second": 16.04, + "eval_steps_per_second": 2.006, + "step": 3600 + }, + { + "entropy": 0.1255835090787747, + "epoch": 9.004981320049813, + "grad_norm": 0.11608047038316727, + "learning_rate": 6.78959990856799e-06, + "loss": 0.06319612860679627, + "mean_token_accuracy": 0.9766685519462976, + "num_tokens": 8453175.0, + "step": 3620 + }, + { + "epoch": 9.004981320049813, + "eval_entropy": 0.2373251837006835, + "eval_loss": 0.9045722484588623, + "eval_mean_token_accuracy": 0.8525558363559634, + "eval_num_tokens": 8453175.0, + "eval_runtime": 85.7435, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.006, + "step": 3620 + }, + { + "entropy": 0.12587778437882663, + "epoch": 9.054794520547945, + "grad_norm": 0.1564614623785019, + "learning_rate": 6.135260262244683e-06, + "loss": 0.0630365788936615, + "mean_token_accuracy": 0.9777486085891723, + "num_tokens": 8497151.0, + "step": 3640 + }, + { + "epoch": 9.054794520547945, + "eval_entropy": 0.23559923721260803, + "eval_loss": 0.9120694398880005, + "eval_mean_token_accuracy": 0.8525292966947999, + "eval_num_tokens": 8497151.0, + "eval_runtime": 85.8018, + "eval_samples_per_second": 16.025, + "eval_steps_per_second": 2.005, + "step": 3640 + }, + { + "entropy": 0.12535365503281354, + "epoch": 9.104607721046078, + "grad_norm": 0.1404249221086502, + "learning_rate": 5.513191704064086e-06, + "loss": 0.060502654314041136, + "mean_token_accuracy": 0.9770058333873749, + "num_tokens": 8542996.0, + "step": 3660 + }, + { + "epoch": 9.104607721046078, + "eval_entropy": 0.23525122691725575, + "eval_loss": 0.9182237982749939, + "eval_mean_token_accuracy": 0.8524098333924316, + "eval_num_tokens": 8542996.0, + "eval_runtime": 85.9872, + "eval_samples_per_second": 15.991, + "eval_steps_per_second": 2.0, + "step": 3660 + }, + { + "entropy": 0.11330419047735632, + "epoch": 9.15442092154421, + "grad_norm": 0.15513843297958374, + "learning_rate": 4.92358184141876e-06, + "loss": 0.05822383761405945, + "mean_token_accuracy": 0.9793384782969952, + "num_tokens": 8591625.0, + "step": 3680 + }, + { + "epoch": 9.15442092154421, + "eval_entropy": 0.2353947116711805, + "eval_loss": 0.9229223132133484, + "eval_mean_token_accuracy": 0.852500357253607, + "eval_num_tokens": 8591625.0, + "eval_runtime": 86.0805, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.998, + "step": 3680 + }, + { + "entropy": 0.11830627010203898, + "epoch": 9.204234122042342, + "grad_norm": 0.1730550080537796, + "learning_rate": 4.366608492601456e-06, + "loss": 0.05860854983329773, + "mean_token_accuracy": 0.9779663667082786, + "num_tokens": 8639845.0, + "step": 3700 + }, + { + "epoch": 9.204234122042342, + "eval_entropy": 0.23567205719476522, + "eval_loss": 0.9269373416900635, + "eval_mean_token_accuracy": 0.8523658004611038, + "eval_num_tokens": 8639845.0, + "eval_runtime": 85.9809, + "eval_samples_per_second": 15.992, + "eval_steps_per_second": 2.0, + "step": 3700 + }, + { + "entropy": 0.1180900705512613, + "epoch": 9.254047322540472, + "grad_norm": 0.20909737050533295, + "learning_rate": 3.842439633177387e-06, + "loss": 0.059438884258270264, + "mean_token_accuracy": 0.9786856278777123, + "num_tokens": 8687194.0, + "step": 3720 + }, + { + "epoch": 9.254047322540472, + "eval_entropy": 0.23602714493524196, + "eval_loss": 0.9293538928031921, + "eval_mean_token_accuracy": 0.8523273440294488, + "eval_num_tokens": 8687194.0, + "eval_runtime": 85.2118, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.019, + "step": 3720 + }, + { + "entropy": 0.13156692241318524, + "epoch": 9.303860523038605, + "grad_norm": 0.12535709142684937, + "learning_rate": 3.3512333453253305e-06, + "loss": 0.06337688565254211, + "mean_token_accuracy": 0.9756712593138218, + "num_tokens": 8731721.0, + "step": 3740 + }, + { + "epoch": 9.303860523038605, + "eval_entropy": 0.23534389351343, + "eval_loss": 0.932999312877655, + "eval_mean_token_accuracy": 0.8523333925147389, + "eval_num_tokens": 8731721.0, + "eval_runtime": 85.953, + "eval_samples_per_second": 15.997, + "eval_steps_per_second": 2.001, + "step": 3740 + }, + { + "entropy": 0.12327516414225101, + "epoch": 9.353673723536737, + "grad_norm": 0.16341575980186462, + "learning_rate": 2.8931377701619306e-06, + "loss": 0.05869622826576233, + "mean_token_accuracy": 0.9784224212169648, + "num_tokens": 8778614.0, + "step": 3760 + }, + { + "epoch": 9.353673723536737, + "eval_entropy": 0.23493653622477553, + "eval_loss": 0.9358566999435425, + "eval_mean_token_accuracy": 0.8522722783476807, + "eval_num_tokens": 8778614.0, + "eval_runtime": 85.2538, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.018, + "step": 3760 + }, + { + "entropy": 0.1134357453789562, + "epoch": 9.403486924034869, + "grad_norm": 0.23999616503715515, + "learning_rate": 2.4682910630645723e-06, + "loss": 0.057540220022201535, + "mean_token_accuracy": 0.9798057802021504, + "num_tokens": 8826551.0, + "step": 3780 + }, + { + "epoch": 9.403486924034869, + "eval_entropy": 0.23470525634150172, + "eval_loss": 0.937556266784668, + "eval_mean_token_accuracy": 0.8523351706044618, + "eval_num_tokens": 8826551.0, + "eval_runtime": 85.7764, + "eval_samples_per_second": 16.03, + "eval_steps_per_second": 2.005, + "step": 3780 + }, + { + "entropy": 0.1075570048764348, + "epoch": 9.453300124533001, + "grad_norm": 0.15417765080928802, + "learning_rate": 2.0768213520055406e-06, + "loss": 0.05581026673316956, + "mean_token_accuracy": 0.9797527104616165, + "num_tokens": 8876556.0, + "step": 3800 + }, + { + "epoch": 9.453300124533001, + "eval_entropy": 0.2347462713545145, + "eval_loss": 0.9383137226104736, + "eval_mean_token_accuracy": 0.8522575324357942, + "eval_num_tokens": 8876556.0, + "eval_runtime": 85.8985, + "eval_samples_per_second": 16.007, + "eval_steps_per_second": 2.002, + "step": 3800 + }, + { + "entropy": 0.12609313456341625, + "epoch": 9.503113325031133, + "grad_norm": 0.22041426599025726, + "learning_rate": 1.7188466989102739e-06, + "loss": 0.06379218697547913, + "mean_token_accuracy": 0.9763593293726445, + "num_tokens": 8920286.0, + "step": 3820 + }, + { + "epoch": 9.503113325031133, + "eval_entropy": 0.23459658849724505, + "eval_loss": 0.9393337965011597, + "eval_mean_token_accuracy": 0.8523633532052817, + "eval_num_tokens": 8920286.0, + "eval_runtime": 85.9348, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.002, + "step": 3820 + }, + { + "entropy": 0.12149709439836442, + "epoch": 9.552926525529266, + "grad_norm": 0.16608643531799316, + "learning_rate": 1.3944750640516357e-06, + "loss": 0.06341606974601746, + "mean_token_accuracy": 0.9771503552794456, + "num_tokens": 8964464.0, + "step": 3840 + }, + { + "epoch": 9.552926525529266, + "eval_entropy": 0.2347291322468325, + "eval_loss": 0.9399036765098572, + "eval_mean_token_accuracy": 0.8523768914300341, + "eval_num_tokens": 8964464.0, + "eval_runtime": 86.1305, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.997, + "step": 3840 + }, + { + "entropy": 0.11724846777506173, + "epoch": 9.602739726027398, + "grad_norm": 0.13613300025463104, + "learning_rate": 1.103804273490497e-06, + "loss": 0.05994418263435364, + "mean_token_accuracy": 0.9778759330511093, + "num_tokens": 9010414.0, + "step": 3860 + }, + { + "epoch": 9.602739726027398, + "eval_entropy": 0.23495923337894817, + "eval_loss": 0.9400841593742371, + "eval_mean_token_accuracy": 0.8523780471363733, + "eval_num_tokens": 9010414.0, + "eval_runtime": 86.0379, + "eval_samples_per_second": 15.981, + "eval_steps_per_second": 1.999, + "step": 3860 + }, + { + "entropy": 0.12054574331268668, + "epoch": 9.65255292652553, + "grad_norm": 0.11884245276451111, + "learning_rate": 8.469219895727582e-07, + "loss": 0.05917409062385559, + "mean_token_accuracy": 0.9771256923675538, + "num_tokens": 9058053.0, + "step": 3880 + }, + { + "epoch": 9.65255292652553, + "eval_entropy": 0.23499552723626757, + "eval_loss": 0.9404177665710449, + "eval_mean_token_accuracy": 0.8523571678372317, + "eval_num_tokens": 9058053.0, + "eval_runtime": 86.0174, + "eval_samples_per_second": 15.985, + "eval_steps_per_second": 2.0, + "step": 3880 + }, + { + "entropy": 0.12163264504633844, + "epoch": 9.70236612702366, + "grad_norm": 0.18393972516059875, + "learning_rate": 6.239056844915407e-07, + "loss": 0.059613007307052615, + "mean_token_accuracy": 0.9776720523834228, + "num_tokens": 9105574.0, + "step": 3900 + }, + { + "epoch": 9.70236612702366, + "eval_entropy": 0.23491846319547918, + "eval_loss": 0.9405836462974548, + "eval_mean_token_accuracy": 0.8523543633000795, + "eval_num_tokens": 9105574.0, + "eval_runtime": 85.9519, + "eval_samples_per_second": 15.997, + "eval_steps_per_second": 2.001, + "step": 3900 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.845510683910492e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3920/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3920/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3920/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3920/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3920/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3920/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3920/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3920/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3920/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3920/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3920/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3920/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3920/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3920/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..4b7a0e528051bee6b418127244f0612bcc5c71e3 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3920/trainer_state.json @@ -0,0 +1,4150 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 9.752179327521793, + "eval_steps": 20, + "global_step": 3920, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + }, + { + "entropy": 0.561330484598875, + "epoch": 1.891656288916563, + "grad_norm": 0.6722865700721741, + "learning_rate": 0.0002208867897174789, + "loss": 0.499837589263916, + "mean_token_accuracy": 0.8518734864890576, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.5865232653396074, + "eval_loss": 0.5437926650047302, + "eval_mean_token_accuracy": 0.8450997017843779, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4116, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.547389242425561, + "epoch": 1.9414694894146949, + "grad_norm": 0.7935577034950256, + "learning_rate": 0.00022027119820226907, + "loss": 0.4977591514587402, + "mean_token_accuracy": 0.8539491161704064, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.5290903090391048, + "eval_loss": 0.5409526824951172, + "eval_mean_token_accuracy": 0.8497545698354411, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.7262, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 780 + }, + { + "entropy": 0.5687909748405218, + "epoch": 1.9912826899128269, + "grad_norm": 0.6180546283721924, + "learning_rate": 0.00021962329729698345, + "loss": 0.5109643459320068, + "mean_token_accuracy": 0.8521598495543004, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.5503541858390321, + "eval_loss": 0.5361555218696594, + "eval_mean_token_accuracy": 0.8510884285666221, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.3339, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 800 + }, + { + "entropy": 0.4739728841261986, + "epoch": 2.0398505603985058, + "grad_norm": 0.8058829307556152, + "learning_rate": 0.0002189432823996982, + "loss": 0.4204097747802734, + "mean_token_accuracy": 0.8728981889211215, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.5077334992414297, + "eval_loss": 0.5531114339828491, + "eval_mean_token_accuracy": 0.8489257208136625, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.4801, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.989, + "step": 820 + }, + { + "entropy": 0.4594309840351343, + "epoch": 2.0896637608966375, + "grad_norm": 0.6906896829605103, + "learning_rate": 0.0002182313585936314, + "loss": 0.4071959495544434, + "mean_token_accuracy": 0.8732857562601566, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.49850136994622474, + "eval_loss": 0.5486204624176025, + "eval_mean_token_accuracy": 0.8507991450470548, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.3364, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.4881629109382629, + "epoch": 2.1394769613947697, + "grad_norm": 0.6343470215797424, + "learning_rate": 0.0002174877405852928, + "loss": 0.41669540405273436, + "mean_token_accuracy": 0.8711295068264008, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.49155513924914734, + "eval_loss": 0.555109441280365, + "eval_mean_token_accuracy": 0.8496399400539176, + "eval_num_tokens": 2008562.0, + "eval_runtime": 86.3295, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 860 + }, + { + "entropy": 0.4648668970912695, + "epoch": 2.1892901618929015, + "grad_norm": 0.8014165163040161, + "learning_rate": 0.00021671265263973133, + "loss": 0.4110250473022461, + "mean_token_accuracy": 0.8754166305065155, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.4909258722219356, + "eval_loss": 0.5539511442184448, + "eval_mean_token_accuracy": 0.8492401502160138, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.3468, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 880 + }, + { + "entropy": 0.4824485514312983, + "epoch": 2.2391033623910337, + "grad_norm": 0.6665191054344177, + "learning_rate": 0.00021590632851289967, + "loss": 0.4181404113769531, + "mean_token_accuracy": 0.8726993151009083, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.4986876940657926, + "eval_loss": 0.547695517539978, + "eval_mean_token_accuracy": 0.8501384708770486, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.3838, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 900 + }, + { + "entropy": 0.4751896943897009, + "epoch": 2.2889165628891655, + "grad_norm": 0.81158047914505, + "learning_rate": 0.00021506901138115678, + "loss": 0.40689678192138673, + "mean_token_accuracy": 0.8745221219956875, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.507153491121392, + "eval_loss": 0.5501641631126404, + "eval_mean_token_accuracy": 0.8495670116918032, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.0912, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 920 + }, + { + "entropy": 0.4873133715242147, + "epoch": 2.3387297633872977, + "grad_norm": 0.7218056321144104, + "learning_rate": 0.0002142009537679292, + "loss": 0.42701358795166017, + "mean_token_accuracy": 0.8695114746689796, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5202612736543943, + "eval_loss": 0.5491839051246643, + "eval_mean_token_accuracy": 0.8494071208460386, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.1142, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 940 + }, + { + "entropy": 0.4762951169162989, + "epoch": 2.3885429638854294, + "grad_norm": 0.7194424867630005, + "learning_rate": 0.0002133024174675534, + "loss": 0.42299847602844237, + "mean_token_accuracy": 0.8709790132939815, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4899340462546016, + "eval_loss": 0.5522511601448059, + "eval_mean_token_accuracy": 0.8492208258357159, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.463, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 960 + }, + { + "entropy": 0.49650347977876663, + "epoch": 2.4383561643835616, + "grad_norm": 0.8406022787094116, + "learning_rate": 0.0002123736734663221, + "loss": 0.4275330066680908, + "mean_token_accuracy": 0.8670595556497573, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.49691385654515996, + "eval_loss": 0.5491269826889038, + "eval_mean_token_accuracy": 0.850309816210769, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.17, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 980 + }, + { + "entropy": 0.48843890577554705, + "epoch": 2.488169364881694, + "grad_norm": 0.9082473516464233, + "learning_rate": 0.00021141500186075868, + "loss": 0.4309722423553467, + "mean_token_accuracy": 0.8686766296625137, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5543508351195691, + "eval_loss": 0.5478800535202026, + "eval_mean_token_accuracy": 0.8478029522784921, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.3835, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 1000 + }, + { + "entropy": 0.4777219031006098, + "epoch": 2.5379825653798256, + "grad_norm": 0.7448089122772217, + "learning_rate": 0.0002104266917731438, + "loss": 0.423325252532959, + "mean_token_accuracy": 0.8706337086856365, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.49857561550168106, + "eval_loss": 0.5511948466300964, + "eval_mean_token_accuracy": 0.8502220289651737, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.5399, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.988, + "step": 1020 + }, + { + "entropy": 0.4844174191355705, + "epoch": 2.587795765877958, + "grad_norm": 0.794029176235199, + "learning_rate": 0.00020940904126432, + "loss": 0.4176753044128418, + "mean_token_accuracy": 0.873535567522049, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.485467542222766, + "eval_loss": 0.5539286732673645, + "eval_mean_token_accuracy": 0.8495475081510322, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.135, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 1.997, + "step": 1040 + }, + { + "entropy": 0.49070929251611234, + "epoch": 2.6376089663760895, + "grad_norm": 0.7558256983757019, + "learning_rate": 0.0002083623572438007, + "loss": 0.42867293357849123, + "mean_token_accuracy": 0.8696666076779366, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.490822730889154, + "eval_loss": 0.5434785485267639, + "eval_mean_token_accuracy": 0.850568296950917, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.4933, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 1060 + }, + { + "entropy": 0.47806114703416824, + "epoch": 2.6874221668742218, + "grad_norm": 0.6608979105949402, + "learning_rate": 0.00020728695537721047, + "loss": 0.4289727687835693, + "mean_token_accuracy": 0.8693130135536193, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.5285773256490397, + "eval_loss": 0.5444230437278748, + "eval_mean_token_accuracy": 0.8498796481032704, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.7091, + "eval_samples_per_second": 15.858, + "eval_steps_per_second": 1.984, + "step": 1080 + }, + { + "entropy": 0.5046216730028391, + "epoch": 2.7372353673723535, + "grad_norm": 0.8428544998168945, + "learning_rate": 0.00020618315999108454, + "loss": 0.43131070137023925, + "mean_token_accuracy": 0.8701941035687923, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.49888394738352576, + "eval_loss": 0.5459766387939453, + "eval_mean_token_accuracy": 0.8511758872935938, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.2222, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.995, + "step": 1100 + }, + { + "entropy": 0.5212558470666409, + "epoch": 2.7870485678704857, + "grad_norm": 1.129318118095398, + "learning_rate": 0.00020505130397505635, + "loss": 0.44249300956726073, + "mean_token_accuracy": 0.8654101334512234, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5179622324053631, + "eval_loss": 0.5522801280021667, + "eval_mean_token_accuracy": 0.8497019947268242, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.1903, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.996, + "step": 1120 + }, + { + "entropy": 0.4988406613469124, + "epoch": 2.8368617683686175, + "grad_norm": 0.6460545063018799, + "learning_rate": 0.00020389172868146263, + "loss": 0.4386270523071289, + "mean_token_accuracy": 0.8690383620560169, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.5042278484203094, + "eval_loss": 0.5433034300804138, + "eval_mean_token_accuracy": 0.8497674451317898, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.3028, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.993, + "step": 1140 + }, + { + "entropy": 0.4926559619605541, + "epoch": 2.8866749688667497, + "grad_norm": 0.8199329972267151, + "learning_rate": 0.00020270478382239615, + "loss": 0.4313485145568848, + "mean_token_accuracy": 0.8674727231264114, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.503873193160046, + "eval_loss": 0.5388111472129822, + "eval_mean_token_accuracy": 0.8526195034731266, + "eval_num_tokens": 2710196.0, + "eval_runtime": 86.4054, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.991, + "step": 1160 + }, + { + "entropy": 0.5020013231784105, + "epoch": 2.936488169364882, + "grad_norm": 0.7344821095466614, + "learning_rate": 0.00020149082736423723, + "loss": 0.43590536117553713, + "mean_token_accuracy": 0.8671772189438343, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5368241809828337, + "eval_loss": 0.5355703830718994, + "eval_mean_token_accuracy": 0.8517617773871089, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.2945, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1180 + }, + { + "entropy": 0.5112275708466768, + "epoch": 2.9863013698630136, + "grad_norm": 0.6951606869697571, + "learning_rate": 0.00020025022541969622, + "loss": 0.43579301834106443, + "mean_token_accuracy": 0.8641206480562686, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.5066795706055885, + "eval_loss": 0.5415249466896057, + "eval_mean_token_accuracy": 0.8493563373421513, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.5005, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.988, + "step": 1200 + }, + { + "entropy": 0.42298635305502474, + "epoch": 3.0348692403486925, + "grad_norm": 0.8201794028282166, + "learning_rate": 0.00019898335213739863, + "loss": 0.35593905448913576, + "mean_token_accuracy": 0.889238600547497, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.4584170470750609, + "eval_loss": 0.569487452507019, + "eval_mean_token_accuracy": 0.8495814173027526, + "eval_num_tokens": 2848509.0, + "eval_runtime": 86.2281, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 1220 + }, + { + "entropy": 0.37450140453875064, + "epoch": 3.0846824408468243, + "grad_norm": 0.7308394908905029, + "learning_rate": 0.0001976905895890471, + "loss": 0.307823920249939, + "mean_token_accuracy": 0.9001288741827012, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.45185995916294497, + "eval_loss": 0.5672881603240967, + "eval_mean_token_accuracy": 0.8511318519364955, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.0819, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.998, + "step": 1240 + }, + { + "entropy": 0.3887945845723152, + "epoch": 3.1344956413449565, + "grad_norm": 0.7299330830574036, + "learning_rate": 0.0001963723276541939, + "loss": 0.32047903537750244, + "mean_token_accuracy": 0.8960984498262405, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.44865354549053105, + "eval_loss": 0.5666037201881409, + "eval_mean_token_accuracy": 0.8496572649063066, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 1260 + }, + { + "entropy": 0.39677664265036583, + "epoch": 3.1843088418430883, + "grad_norm": 0.9533219933509827, + "learning_rate": 0.00019502896390265838, + "loss": 0.3253983497619629, + "mean_token_accuracy": 0.8964207418262958, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.4641980809527774, + "eval_loss": 0.5814996957778931, + "eval_mean_token_accuracy": 0.8485886212005171, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.7784, + "eval_samples_per_second": 15.845, + "eval_steps_per_second": 1.982, + "step": 1280 + }, + { + "entropy": 0.39210722744464876, + "epoch": 3.2341220423412205, + "grad_norm": 0.7447651028633118, + "learning_rate": 0.00019366090347462545, + "loss": 0.3276803970336914, + "mean_token_accuracy": 0.8930055953562259, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43595615254585135, + "eval_loss": 0.5722188353538513, + "eval_mean_token_accuracy": 0.8501105755567551, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.5271, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 1300 + }, + { + "entropy": 0.3684127271175385, + "epoch": 3.2839352428393527, + "grad_norm": 0.6934201121330261, + "learning_rate": 0.00019226855895846078, + "loss": 0.3156379222869873, + "mean_token_accuracy": 0.8976306475698947, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.4628148723480313, + "eval_loss": 0.5631352066993713, + "eval_mean_token_accuracy": 0.8504934813394103, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.3436, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 1320 + }, + { + "entropy": 0.4073401909321547, + "epoch": 3.3337484433374844, + "grad_norm": 0.9386897683143616, + "learning_rate": 0.00019085235026627994, + "loss": 0.34265310764312745, + "mean_token_accuracy": 0.8902062118053437, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.46455050623694133, + "eval_loss": 0.5586736798286438, + "eval_mean_token_accuracy": 0.8506874702004499, + "eval_num_tokens": 3132874.0, + "eval_runtime": 86.1286, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.997, + "step": 1340 + }, + { + "entropy": 0.4046429242938757, + "epoch": 3.383561643835616, + "grad_norm": 0.9633992314338684, + "learning_rate": 0.00018941270450730836, + "loss": 0.33816893100738527, + "mean_token_accuracy": 0.8927541889250279, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.46846531660750856, + "eval_loss": 0.561501681804657, + "eval_mean_token_accuracy": 0.8496256377114806, + "eval_num_tokens": 3178055.0, + "eval_runtime": 86.685, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1360 + }, + { + "entropy": 0.39872407019138334, + "epoch": 3.4333748443337484, + "grad_norm": 0.7786458730697632, + "learning_rate": 0.00018795005585907113, + "loss": 0.33342490196228025, + "mean_token_accuracy": 0.8944805048406124, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.42709505973860273, + "eval_loss": 0.5751848220825195, + "eval_mean_token_accuracy": 0.8507290447867194, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.6892, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 1380 + }, + { + "entropy": 0.3923338124528527, + "epoch": 3.4831880448318806, + "grad_norm": 0.9305956363677979, + "learning_rate": 0.0001864648454364511, + "loss": 0.33188116550445557, + "mean_token_accuracy": 0.8943330392241478, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.4386174779298694, + "eval_loss": 0.5680831074714661, + "eval_mean_token_accuracy": 0.8513129727784977, + "eval_num_tokens": 3274096.0, + "eval_runtime": 86.2671, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 1400 + }, + { + "entropy": 0.3856233984231949, + "epoch": 3.5330012453300124, + "grad_norm": 1.0362752676010132, + "learning_rate": 0.0001849575211586545, + "loss": 0.33098697662353516, + "mean_token_accuracy": 0.8961390435695649, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4574795474493226, + "eval_loss": 0.5630439519882202, + "eval_mean_token_accuracy": 0.8520988873964133, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.6035, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 1420 + }, + { + "entropy": 0.39812871962785723, + "epoch": 3.5828144458281446, + "grad_norm": 0.7807195782661438, + "learning_rate": 0.0001834285376141247, + "loss": 0.3333771228790283, + "mean_token_accuracy": 0.8930827379226685, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.4556825893909432, + "eval_loss": 0.5689062476158142, + "eval_mean_token_accuracy": 0.8507103507601937, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.1606, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.996, + "step": 1440 + }, + { + "entropy": 0.4147744856774807, + "epoch": 3.6326276463262763, + "grad_norm": 0.6429352164268494, + "learning_rate": 0.00018187835592344443, + "loss": 0.3482560873031616, + "mean_token_accuracy": 0.8910200245678425, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.46600024540757023, + "eval_loss": 0.5609709024429321, + "eval_mean_token_accuracy": 0.8491220876227977, + "eval_num_tokens": 3415600.0, + "eval_runtime": 86.8039, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1460 + }, + { + "entropy": 0.40425071083009245, + "epoch": 3.6824408468244085, + "grad_norm": 0.8613698482513428, + "learning_rate": 0.0001803074436002682, + "loss": 0.342916464805603, + "mean_token_accuracy": 0.8916418336331844, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.43855057899342026, + "eval_loss": 0.5720968246459961, + "eval_mean_token_accuracy": 0.8500823641932288, + "eval_num_tokens": 3460471.0, + "eval_runtime": 86.6746, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1480 + }, + { + "entropy": 0.39465143866837027, + "epoch": 3.7322540473225407, + "grad_norm": 0.6285189986228943, + "learning_rate": 0.0001787162744103265, + "loss": 0.3424591779708862, + "mean_token_accuracy": 0.8906558901071548, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4509461877304454, + "eval_loss": 0.5590082406997681, + "eval_mean_token_accuracy": 0.8511747371318729, + "eval_num_tokens": 3507647.0, + "eval_runtime": 86.8126, + "eval_samples_per_second": 15.839, + "eval_steps_per_second": 1.981, + "step": 1500 + }, + { + "entropy": 0.4021005939692259, + "epoch": 3.7820672478206725, + "grad_norm": 0.8821248412132263, + "learning_rate": 0.00017710532822854468, + "loss": 0.3462103843688965, + "mean_token_accuracy": 0.889109355956316, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.4502199075596277, + "eval_loss": 0.566046416759491, + "eval_mean_token_accuracy": 0.8501714208098345, + "eval_num_tokens": 3548934.0, + "eval_runtime": 86.8336, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.981, + "step": 1520 + }, + { + "entropy": 0.4017397932708263, + "epoch": 3.8318804483188043, + "grad_norm": 0.8400952816009521, + "learning_rate": 0.0001754750908943189, + "loss": 0.34890995025634763, + "mean_token_accuracy": 0.8892098367214203, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.4614003023435903, + "eval_loss": 0.5617933869361877, + "eval_mean_token_accuracy": 0.8515863616106122, + "eval_num_tokens": 3597186.0, + "eval_runtime": 86.4609, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 1540 + }, + { + "entropy": 0.4112051840871572, + "epoch": 3.8816936488169365, + "grad_norm": 0.769478440284729, + "learning_rate": 0.0001738260540649939, + "loss": 0.34711437225341796, + "mean_token_accuracy": 0.8911717928946018, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4540443811998811, + "eval_loss": 0.5576469898223877, + "eval_mean_token_accuracy": 0.8512079674144124, + "eval_num_tokens": 3646646.0, + "eval_runtime": 86.5103, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 1560 + }, + { + "entropy": 0.41105241514742374, + "epoch": 3.9315068493150687, + "grad_norm": 0.8468427062034607, + "learning_rate": 0.00017215871506758568, + "loss": 0.3433023452758789, + "mean_token_accuracy": 0.8898739732801915, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.4707539707075718, + "eval_loss": 0.5641466379165649, + "eval_mean_token_accuracy": 0.8495440957851188, + "eval_num_tokens": 3689560.0, + "eval_runtime": 86.609, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.986, + "step": 1580 + }, + { + "entropy": 0.41016379147768023, + "epoch": 3.9813200498132004, + "grad_norm": 0.7482675313949585, + "learning_rate": 0.0001704735767487946, + "loss": 0.34550890922546384, + "mean_token_accuracy": 0.8893028847873211, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.46391099864660307, + "eval_loss": 0.5593640804290771, + "eval_mean_token_accuracy": 0.8510130581467651, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.3975, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 1600 + }, + { + "entropy": 0.33167599791135544, + "epoch": 4.029887920298879, + "grad_norm": 0.9435692429542542, + "learning_rate": 0.00016877114732335337, + "loss": 0.2716026544570923, + "mean_token_accuracy": 0.9133149828666296, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.38499350005457567, + "eval_loss": 0.6298249363899231, + "eval_mean_token_accuracy": 0.8488117071778275, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.2933, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1620 + }, + { + "entropy": 0.3000166634097695, + "epoch": 4.0797011207970115, + "grad_norm": 0.8080845475196838, + "learning_rate": 0.0001670519402207569, + "loss": 0.22617182731628419, + "mean_token_accuracy": 0.9253474645316601, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.370110988703578, + "eval_loss": 0.6338461637496948, + "eval_mean_token_accuracy": 0.8485634801692741, + "eval_num_tokens": 3828830.0, + "eval_runtime": 85.9508, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.001, + "step": 1640 + }, + { + "entropy": 0.2986910421401262, + "epoch": 4.129514321295143, + "grad_norm": 0.7310900092124939, + "learning_rate": 0.0001653164739304185, + "loss": 0.22367463111877442, + "mean_token_accuracy": 0.9252275295555592, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.3944379702037157, + "eval_loss": 0.6109381914138794, + "eval_mean_token_accuracy": 0.849291454220927, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.6728, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1660 + }, + { + "entropy": 0.3095553796738386, + "epoch": 4.179327521793275, + "grad_norm": 0.7059140801429749, + "learning_rate": 0.0001635652718453007, + "loss": 0.23651680946350098, + "mean_token_accuracy": 0.9208931416273117, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.3910588648949945, + "eval_loss": 0.6104469299316406, + "eval_mean_token_accuracy": 0.8486883893262508, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7612, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.982, + "step": 1680 + }, + { + "entropy": 0.3001101028174162, + "epoch": 4.229140722291407, + "grad_norm": 0.6787802577018738, + "learning_rate": 0.00016179886210406728, + "loss": 0.23130471706390382, + "mean_token_accuracy": 0.9233332790434361, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3794369170832079, + "eval_loss": 0.6182110905647278, + "eval_mean_token_accuracy": 0.8495433777570724, + "eval_num_tokens": 3967474.0, + "eval_runtime": 85.94, + "eval_samples_per_second": 16.0, + "eval_steps_per_second": 2.001, + "step": 1700 + }, + { + "entropy": 0.3031421799212694, + "epoch": 4.2789539227895395, + "grad_norm": 0.9732038378715515, + "learning_rate": 0.0001600177774318036, + "loss": 0.2359529733657837, + "mean_token_accuracy": 0.9217648565769195, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3923123094231583, + "eval_loss": 0.6057384610176086, + "eval_mean_token_accuracy": 0.8508818288182103, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7647, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.29365369994193313, + "epoch": 4.328767123287671, + "grad_norm": 0.7681498527526855, + "learning_rate": 0.0001582225549793541, + "loss": 0.2269371747970581, + "mean_token_accuracy": 0.9245341829955578, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.4011661055129628, + "eval_loss": 0.6144486665725708, + "eval_mean_token_accuracy": 0.8480324357054955, + "eval_num_tokens": 4062594.0, + "eval_runtime": 87.1306, + "eval_samples_per_second": 15.781, + "eval_steps_per_second": 1.974, + "step": 1740 + }, + { + "entropy": 0.29396994728595016, + "epoch": 4.378580323785803, + "grad_norm": 1.0001007318496704, + "learning_rate": 0.0001564137361613248, + "loss": 0.22777395248413085, + "mean_token_accuracy": 0.9262309700250626, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38518730195802314, + "eval_loss": 0.6202630400657654, + "eval_mean_token_accuracy": 0.8493869807137999, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6616, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.3096018506214023, + "epoch": 4.428393524283935, + "grad_norm": 1.0448365211486816, + "learning_rate": 0.00015459186649280024, + "loss": 0.23696351051330566, + "mean_token_accuracy": 0.9217322513461113, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.3946371126140273, + "eval_loss": 0.6079026460647583, + "eval_mean_token_accuracy": 0.8492515852978063, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6582, + "eval_samples_per_second": 15.867, + "eval_steps_per_second": 1.985, + "step": 1780 + }, + { + "entropy": 0.32619857545942066, + "epoch": 4.478206724782067, + "grad_norm": 0.7210651636123657, + "learning_rate": 0.00015275749542482337, + "loss": 0.24651215076446534, + "mean_token_accuracy": 0.9177676141262054, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.3947690814560236, + "eval_loss": 0.6065912246704102, + "eval_mean_token_accuracy": 0.8502957744653835, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.5959, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.986, + "step": 1800 + }, + { + "entropy": 0.3193941755220294, + "epoch": 4.5280199252802, + "grad_norm": 0.8281906843185425, + "learning_rate": 0.0001509111761786888, + "loss": 0.23936262130737304, + "mean_token_accuracy": 0.9201708927750587, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38704028864239537, + "eval_loss": 0.6006569266319275, + "eval_mean_token_accuracy": 0.8502406720505205, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.8059, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1820 + }, + { + "entropy": 0.3164879363030195, + "epoch": 4.577833125778331, + "grad_norm": 0.7892968654632568, + "learning_rate": 0.00014905346557909867, + "loss": 0.24541733264923096, + "mean_token_accuracy": 0.9175932116806507, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.38861122120951497, + "eval_loss": 0.6115967631340027, + "eval_mean_token_accuracy": 0.849471275196519, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.2946, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1840 + }, + { + "entropy": 0.3051785985007882, + "epoch": 4.627646326276463, + "grad_norm": 0.8109654188156128, + "learning_rate": 0.0001471849238862319, + "loss": 0.23433220386505127, + "mean_token_accuracy": 0.9206570319831371, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.37162452295076015, + "eval_loss": 0.6184061765670776, + "eval_mean_token_accuracy": 0.8501173268223918, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.6865, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1860 + }, + { + "entropy": 0.3168198253959417, + "epoch": 4.677459526774595, + "grad_norm": 0.9512342214584351, + "learning_rate": 0.0001453061146267775, + "loss": 0.23832404613494873, + "mean_token_accuracy": 0.9197044663131237, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3845940856912801, + "eval_loss": 0.606762707233429, + "eval_mean_token_accuracy": 0.8504838194957999, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.5175, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 1880 + }, + { + "entropy": 0.30791807882487776, + "epoch": 4.7272727272727275, + "grad_norm": 0.8123113512992859, + "learning_rate": 0.00014341760442398248, + "loss": 0.2395785331726074, + "mean_token_accuracy": 0.918928150832653, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.39762327222283494, + "eval_loss": 0.5994202494621277, + "eval_mean_token_accuracy": 0.8509274201337681, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.2873, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.993, + "step": 1900 + }, + { + "entropy": 0.3021434534341097, + "epoch": 4.777085927770859, + "grad_norm": 0.731787383556366, + "learning_rate": 0.000141519962826766, + "loss": 0.23494718074798585, + "mean_token_accuracy": 0.9201403826475143, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.3827026732439219, + "eval_loss": 0.5995895862579346, + "eval_mean_token_accuracy": 0.851468373523202, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.3006, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 1920 + }, + { + "entropy": 0.31626159623265265, + "epoch": 4.826899128268991, + "grad_norm": 0.8848487138748169, + "learning_rate": 0.00013961376213795132, + "loss": 0.2439030647277832, + "mean_token_accuracy": 0.9196575872600079, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.388698436839636, + "eval_loss": 0.6000174283981323, + "eval_mean_token_accuracy": 0.8518068187458571, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.8979, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.979, + "step": 1940 + }, + { + "entropy": 0.30520407035946845, + "epoch": 4.876712328767123, + "grad_norm": 0.8532460927963257, + "learning_rate": 0.00013769957724166695, + "loss": 0.23458616733551024, + "mean_token_accuracy": 0.9221912942826748, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.38777847102908203, + "eval_loss": 0.6004981398582458, + "eval_mean_token_accuracy": 0.8516481768253238, + "eval_num_tokens": 4578167.0, + "eval_runtime": 87.0777, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.975, + "step": 1960 + }, + { + "entropy": 0.3226448342204094, + "epoch": 4.926525529265255, + "grad_norm": 0.6945561766624451, + "learning_rate": 0.0001357779854299694, + "loss": 0.24048397541046143, + "mean_token_accuracy": 0.9195300146937371, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.38581624263247777, + "eval_loss": 0.6029234528541565, + "eval_mean_token_accuracy": 0.8514213260523108, + "eval_num_tokens": 4622316.0, + "eval_runtime": 85.8729, + "eval_samples_per_second": 16.012, + "eval_steps_per_second": 2.003, + "step": 1980 + }, + { + "entropy": 0.3051655298098922, + "epoch": 4.976338729763388, + "grad_norm": 0.7976452708244324, + "learning_rate": 0.00013384956622874001, + "loss": 0.23584742546081544, + "mean_token_accuracy": 0.9216851457953453, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.37913159246361533, + "eval_loss": 0.6057604551315308, + "eval_mean_token_accuracy": 0.8525801203971686, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.1145, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 2000 + }, + { + "entropy": 0.27438195240803254, + "epoch": 5.024906600249066, + "grad_norm": 0.6729586124420166, + "learning_rate": 0.0001319149012229075, + "loss": 0.19775952100753785, + "mean_token_accuracy": 0.9339428559327737, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.3448961910813354, + "eval_loss": 0.6750120520591736, + "eval_mean_token_accuracy": 0.8487970232963562, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.1169, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 2020 + }, + { + "entropy": 0.21423916313797237, + "epoch": 5.074719800747198, + "grad_norm": 0.6934391856193542, + "learning_rate": 0.00012997457388105022, + "loss": 0.1439570426940918, + "mean_token_accuracy": 0.9528236843645572, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.3570949243771475, + "eval_loss": 0.6465504169464111, + "eval_mean_token_accuracy": 0.8490785547467166, + "eval_num_tokens": 4763269.0, + "eval_runtime": 85.9574, + "eval_samples_per_second": 15.996, + "eval_steps_per_second": 2.001, + "step": 2040 + }, + { + "entropy": 0.20838565267622472, + "epoch": 5.12453300124533, + "grad_norm": 0.7286986112594604, + "learning_rate": 0.00012802916937942972, + "loss": 0.14467307329177856, + "mean_token_accuracy": 0.950994835793972, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.3452463157821533, + "eval_loss": 0.6705958843231201, + "eval_mean_token_accuracy": 0.8490352796953778, + "eval_num_tokens": 4809047.0, + "eval_runtime": 86.228, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 2060 + }, + { + "entropy": 0.20453082229942082, + "epoch": 5.174346201743462, + "grad_norm": 0.7515555620193481, + "learning_rate": 0.00012607927442550974, + "loss": 0.13732000589370727, + "mean_token_accuracy": 0.9537357829511166, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.32431264914745506, + "eval_loss": 0.6743043065071106, + "eval_mean_token_accuracy": 0.8504878629085629, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.5948, + "eval_samples_per_second": 15.879, + "eval_steps_per_second": 1.986, + "step": 2080 + }, + { + "entropy": 0.21812320686876774, + "epoch": 5.224159402241594, + "grad_norm": 0.9093465209007263, + "learning_rate": 0.0001241254770810132, + "loss": 0.14311420917510986, + "mean_token_accuracy": 0.9514068141579628, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.33086285835435225, + "eval_loss": 0.6676449179649353, + "eval_mean_token_accuracy": 0.8505287662495015, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 2100 + }, + { + "entropy": 0.2180163251236081, + "epoch": 5.273972602739726, + "grad_norm": 0.6703007221221924, + "learning_rate": 0.00012216836658457075, + "loss": 0.14803968667984008, + "mean_token_accuracy": 0.9521303348243236, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.33162341708707255, + "eval_loss": 0.6658875942230225, + "eval_mean_token_accuracy": 0.8500757605530495, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.6296, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 2120 + }, + { + "entropy": 0.22511130161583423, + "epoch": 5.323785803237858, + "grad_norm": 0.8078880906105042, + "learning_rate": 0.00012020853317401455, + "loss": 0.15228408575057983, + "mean_token_accuracy": 0.947144789993763, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3354601170434508, + "eval_loss": 0.6677829623222351, + "eval_mean_token_accuracy": 0.8482600024273229, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.4689, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.989, + "step": 2140 + }, + { + "entropy": 0.2244176059961319, + "epoch": 5.37359900373599, + "grad_norm": 0.9636075496673584, + "learning_rate": 0.00011824656790837037, + "loss": 0.15260883569717407, + "mean_token_accuracy": 0.9471467643976211, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.3381616926297199, + "eval_loss": 0.6694412231445312, + "eval_mean_token_accuracy": 0.8482369603805764, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.4147, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 2160 + }, + { + "entropy": 0.22982364390045404, + "epoch": 5.423412204234122, + "grad_norm": 0.775401771068573, + "learning_rate": 0.00011628306248960262, + "loss": 0.15140302181243898, + "mean_token_accuracy": 0.9492553934454918, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.3305150235808173, + "eval_loss": 0.6717822551727295, + "eval_mean_token_accuracy": 0.8489849723355715, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.4728, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.989, + "step": 2180 + }, + { + "entropy": 0.21448935717344284, + "epoch": 5.473225404732254, + "grad_norm": 0.6575281023979187, + "learning_rate": 0.00011431860908416465, + "loss": 0.1452319622039795, + "mean_token_accuracy": 0.9505287684500218, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3488145174328671, + "eval_loss": 0.6612305641174316, + "eval_mean_token_accuracy": 0.8492907808963642, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6927, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 2200 + }, + { + "entropy": 0.23091202937066554, + "epoch": 5.523038605230386, + "grad_norm": 0.8909686207771301, + "learning_rate": 0.00011235380014440985, + "loss": 0.15150139331817628, + "mean_token_accuracy": 0.9497875183820724, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.3268539015810157, + "eval_loss": 0.6667542457580566, + "eval_mean_token_accuracy": 0.8499062903398691, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.4644, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 2220 + }, + { + "entropy": 0.2227974807843566, + "epoch": 5.572851805728518, + "grad_norm": 0.6180275082588196, + "learning_rate": 0.0001103892282299158, + "loss": 0.1491069197654724, + "mean_token_accuracy": 0.9488144010305405, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3346347655494546, + "eval_loss": 0.6665948629379272, + "eval_mean_token_accuracy": 0.8499961893918903, + "eval_num_tokens": 5226864.0, + "eval_runtime": 87.0548, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.976, + "step": 2240 + }, + { + "entropy": 0.21368421968072654, + "epoch": 5.62266500622665, + "grad_norm": 0.6004369258880615, + "learning_rate": 0.00010842548582877651, + "loss": 0.14485255479812623, + "mean_token_accuracy": 0.9502056457102299, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.32753298804163933, + "eval_loss": 0.6680151224136353, + "eval_mean_token_accuracy": 0.8515451086121936, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.8524, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.98, + "step": 2260 + }, + { + "entropy": 0.2103635374456644, + "epoch": 5.672478206724782, + "grad_norm": 0.699174702167511, + "learning_rate": 0.00010646316517891613, + "loss": 0.14297772645950318, + "mean_token_accuracy": 0.9512537539005279, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.32966585959806, + "eval_loss": 0.675578773021698, + "eval_mean_token_accuracy": 0.8509623023659684, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.4518, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.99, + "step": 2280 + }, + { + "entropy": 0.22516900151968003, + "epoch": 5.722291407222914, + "grad_norm": 0.6637354493141174, + "learning_rate": 0.00010450285808947797, + "loss": 0.15202572345733642, + "mean_token_accuracy": 0.9482452072203159, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3369456917740578, + "eval_loss": 0.6697061061859131, + "eval_mean_token_accuracy": 0.848603522361711, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.6371, + "eval_samples_per_second": 15.871, + "eval_steps_per_second": 1.985, + "step": 2300 + }, + { + "entropy": 0.21841065725311637, + "epoch": 5.772104607721046, + "grad_norm": 0.7940268516540527, + "learning_rate": 0.00010254515576234297, + "loss": 0.14710167646408082, + "mean_token_accuracy": 0.9493498183786869, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3237486180177955, + "eval_loss": 0.6779657602310181, + "eval_mean_token_accuracy": 0.8500715313955794, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.1826, + "eval_samples_per_second": 15.954, + "eval_steps_per_second": 1.996, + "step": 2320 + }, + { + "entropy": 0.22146204356104135, + "epoch": 5.821917808219178, + "grad_norm": 0.9234833121299744, + "learning_rate": 0.00010059064861383132, + "loss": 0.14720046520233154, + "mean_token_accuracy": 0.9493872679769992, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.32365207564692167, + "eval_loss": 0.6704005002975464, + "eval_mean_token_accuracy": 0.8507985760306203, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.5494, + "eval_samples_per_second": 15.887, + "eval_steps_per_second": 1.987, + "step": 2340 + }, + { + "entropy": 0.20934011954814197, + "epoch": 5.87173100871731, + "grad_norm": 0.5547503232955933, + "learning_rate": 9.863992609664084e-05, + "loss": 0.1464867353439331, + "mean_token_accuracy": 0.9503875687718392, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.3330401429083458, + "eval_loss": 0.6659091114997864, + "eval_mean_token_accuracy": 0.8504848906467127, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.5855, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 2360 + }, + { + "entropy": 0.21678635366261007, + "epoch": 5.921544209215442, + "grad_norm": 0.570612907409668, + "learning_rate": 9.669357652207635e-05, + "loss": 0.14821385145187377, + "mean_token_accuracy": 0.9503940217196941, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3322022325077722, + "eval_loss": 0.6722489595413208, + "eval_mean_token_accuracy": 0.8489979422369669, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.2986, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 2380 + }, + { + "entropy": 0.20932920072227718, + "epoch": 5.971357409713574, + "grad_norm": 0.7879557609558105, + "learning_rate": 9.475218688262262e-05, + "loss": 0.14675841331481934, + "mean_token_accuracy": 0.9507176131010056, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.3199348642902319, + "eval_loss": 0.6698136329650879, + "eval_mean_token_accuracy": 0.8514142130003419, + "eval_num_tokens": 5605400.0, + "eval_runtime": 85.8995, + "eval_samples_per_second": 16.007, + "eval_steps_per_second": 2.002, + "step": 2400 + }, + { + "entropy": 0.21032143919131693, + "epoch": 6.019925280199253, + "grad_norm": 0.5823076367378235, + "learning_rate": 9.281634267491569e-05, + "loss": 0.13322267532348633, + "mean_token_accuracy": 0.9550939072401096, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.30206270117399303, + "eval_loss": 0.7093168497085571, + "eval_mean_token_accuracy": 0.8500627639681794, + "eval_num_tokens": 5648968.0, + "eval_runtime": 85.8128, + "eval_samples_per_second": 16.023, + "eval_steps_per_second": 2.004, + "step": 2420 + }, + { + "entropy": 0.1534628233872354, + "epoch": 6.069738480697385, + "grad_norm": 0.710133969783783, + "learning_rate": 9.088662772316508e-05, + "loss": 0.09078952670097351, + "mean_token_accuracy": 0.9678447999060154, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.28208133101809857, + "eval_loss": 0.7636417150497437, + "eval_mean_token_accuracy": 0.8494061477655588, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9724, + "eval_samples_per_second": 15.994, + "eval_steps_per_second": 2.001, + "step": 2440 + }, + { + "entropy": 0.16151462448760867, + "epoch": 6.119551681195516, + "grad_norm": 0.5793812274932861, + "learning_rate": 8.896362400308028e-05, + "loss": 0.09545697569847107, + "mean_token_accuracy": 0.9671573750674725, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.2833245605403601, + "eval_loss": 0.7402405738830566, + "eval_mean_token_accuracy": 0.8503523728875226, + "eval_num_tokens": 5745090.0, + "eval_runtime": 85.5461, + "eval_samples_per_second": 16.073, + "eval_steps_per_second": 2.011, + "step": 2460 + }, + { + "entropy": 0.15203177919611335, + "epoch": 6.169364881693649, + "grad_norm": 0.4251123368740082, + "learning_rate": 8.704791146635483e-05, + "loss": 0.09420782327651978, + "mean_token_accuracy": 0.9677386932075024, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.28572545962971313, + "eval_loss": 0.735416829586029, + "eval_mean_token_accuracy": 0.8487084663884584, + "eval_num_tokens": 5790333.0, + "eval_runtime": 85.4801, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.012, + "step": 2480 + }, + { + "entropy": 0.15587336672469973, + "epoch": 6.219178082191781, + "grad_norm": 0.4357028007507324, + "learning_rate": 8.514006786576085e-05, + "loss": 0.09429320096969604, + "mean_token_accuracy": 0.9682952925562859, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.2859006894882335, + "eval_loss": 0.7347224950790405, + "eval_mean_token_accuracy": 0.8501905518215757, + "eval_num_tokens": 5837321.0, + "eval_runtime": 85.7578, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.006, + "step": 2500 + }, + { + "entropy": 0.15765639198943973, + "epoch": 6.268991282689913, + "grad_norm": 0.47331130504608154, + "learning_rate": 8.324066858090663e-05, + "loss": 0.09571113586425781, + "mean_token_accuracy": 0.9683481335639954, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.29231513846059176, + "eval_loss": 0.7392512559890747, + "eval_mean_token_accuracy": 0.8486633983462356, + "eval_num_tokens": 5884398.0, + "eval_runtime": 85.7846, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.005, + "step": 2520 + }, + { + "entropy": 0.16176860257983208, + "epoch": 6.318804483188045, + "grad_norm": 0.6142018437385559, + "learning_rate": 8.135028644470992e-05, + "loss": 0.09486144185066223, + "mean_token_accuracy": 0.9682316601276397, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.2851274753379267, + "eval_loss": 0.7520816922187805, + "eval_mean_token_accuracy": 0.8501113649717597, + "eval_num_tokens": 5929876.0, + "eval_runtime": 85.9425, + "eval_samples_per_second": 15.999, + "eval_steps_per_second": 2.001, + "step": 2540 + }, + { + "entropy": 0.15404034564271568, + "epoch": 6.3686176836861765, + "grad_norm": 0.6051287651062012, + "learning_rate": 7.946949157063964e-05, + "loss": 0.09280472993850708, + "mean_token_accuracy": 0.9684635892510414, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28802703563557114, + "eval_loss": 0.7439162135124207, + "eval_mean_token_accuracy": 0.8499851770872293, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.0703, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.998, + "step": 2560 + }, + { + "entropy": 0.15343588953837753, + "epoch": 6.418430884184309, + "grad_norm": 0.4823743402957916, + "learning_rate": 7.759885118077701e-05, + "loss": 0.09000591039657593, + "mean_token_accuracy": 0.9699928767979145, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2795634938533916, + "eval_loss": 0.7647850513458252, + "eval_mean_token_accuracy": 0.8503464397995971, + "eval_num_tokens": 6025380.0, + "eval_runtime": 85.8886, + "eval_samples_per_second": 16.009, + "eval_steps_per_second": 2.003, + "step": 2580 + }, + { + "entropy": 0.15740026142448188, + "epoch": 6.468244084682441, + "grad_norm": 0.5082696676254272, + "learning_rate": 7.57389294347494e-05, + "loss": 0.09191849827766418, + "mean_token_accuracy": 0.9692809768021107, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2913342311458532, + "eval_loss": 0.7518694996833801, + "eval_mean_token_accuracy": 0.8483168302580367, + "eval_num_tokens": 6073349.0, + "eval_runtime": 85.5761, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.01, + "step": 2600 + }, + { + "entropy": 0.15922069251537324, + "epoch": 6.518057285180573, + "grad_norm": 0.3995199501514435, + "learning_rate": 7.389028725958736e-05, + "loss": 0.09584367871284485, + "mean_token_accuracy": 0.9685114495456218, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.2863075934177221, + "eval_loss": 0.7539381384849548, + "eval_mean_token_accuracy": 0.8507507083027862, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.112, + "eval_samples_per_second": 15.968, + "eval_steps_per_second": 1.997, + "step": 2620 + }, + { + "entropy": 0.16197575423866512, + "epoch": 6.567870485678705, + "grad_norm": 0.534295380115509, + "learning_rate": 7.205348218055678e-05, + "loss": 0.0961170256137848, + "mean_token_accuracy": 0.9674530044198036, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.29021967315050057, + "eval_loss": 0.751198947429657, + "eval_mean_token_accuracy": 0.8509796344956686, + "eval_num_tokens": 6165523.0, + "eval_runtime": 85.7958, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.005, + "step": 2640 + }, + { + "entropy": 0.15261746793985367, + "epoch": 6.617683686176837, + "grad_norm": 0.5391237139701843, + "learning_rate": 7.022906815301673e-05, + "loss": 0.0926026999950409, + "mean_token_accuracy": 0.9695659473538398, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.29128045216202736, + "eval_loss": 0.7450292110443115, + "eval_mean_token_accuracy": 0.8498771443616512, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.3963, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 2660 + }, + { + "entropy": 0.16164180357009172, + "epoch": 6.667496886674969, + "grad_norm": 0.5767946243286133, + "learning_rate": 6.841759539535419e-05, + "loss": 0.09291981458663941, + "mean_token_accuracy": 0.9687136687338352, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2897637223088464, + "eval_loss": 0.7503410577774048, + "eval_mean_token_accuracy": 0.8503315164599308, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.0653, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.998, + "step": 2680 + }, + { + "entropy": 0.17062523355707526, + "epoch": 6.717310087173101, + "grad_norm": 0.4974168539047241, + "learning_rate": 6.661961022304563e-05, + "loss": 0.09713236689567566, + "mean_token_accuracy": 0.9661971725523472, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2765843396963075, + "eval_loss": 0.7604002356529236, + "eval_mean_token_accuracy": 0.8521115277395692, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.1676, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 2700 + }, + { + "entropy": 0.17544092936441302, + "epoch": 6.767123287671232, + "grad_norm": 0.5523537993431091, + "learning_rate": 6.483565488389582e-05, + "loss": 0.09709116220474243, + "mean_token_accuracy": 0.9650957375764847, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.27939334659035814, + "eval_loss": 0.7534670829772949, + "eval_mean_token_accuracy": 0.851230604010959, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.2913, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 2720 + }, + { + "entropy": 0.15991022661328316, + "epoch": 6.816936488169365, + "grad_norm": 0.478551983833313, + "learning_rate": 6.306626739450311e-05, + "loss": 0.09564646482467651, + "mean_token_accuracy": 0.9679084822535515, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.27878295491601146, + "eval_loss": 0.7519959211349487, + "eval_mean_token_accuracy": 0.8510654949864676, + "eval_num_tokens": 6397720.0, + "eval_runtime": 85.9109, + "eval_samples_per_second": 16.005, + "eval_steps_per_second": 2.002, + "step": 2740 + }, + { + "entropy": 0.16824879590421915, + "epoch": 6.866749688667497, + "grad_norm": 0.6681098937988281, + "learning_rate": 6.131198137800108e-05, + "loss": 0.0962279736995697, + "mean_token_accuracy": 0.966830012947321, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.2834690434121808, + "eval_loss": 0.751922070980072, + "eval_mean_token_accuracy": 0.8521237577809844, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.3618, + "eval_samples_per_second": 15.921, + "eval_steps_per_second": 1.992, + "step": 2760 + }, + { + "entropy": 0.1518704930320382, + "epoch": 6.916562889165629, + "grad_norm": 0.5201290249824524, + "learning_rate": 5.957332590312513e-05, + "loss": 0.09010660648345947, + "mean_token_accuracy": 0.9693463340401649, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.28485129617674404, + "eval_loss": 0.7452457547187805, + "eval_mean_token_accuracy": 0.8512036796919135, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.4524, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.99, + "step": 2780 + }, + { + "entropy": 0.15512610590085388, + "epoch": 6.966376089663761, + "grad_norm": 0.42802050709724426, + "learning_rate": 5.785082532465233e-05, + "loss": 0.09320432543754578, + "mean_token_accuracy": 0.9686134628951549, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.27554594526110693, + "eval_loss": 0.7644653916358948, + "eval_mean_token_accuracy": 0.8513738523389018, + "eval_num_tokens": 6540175.0, + "eval_runtime": 85.7609, + "eval_samples_per_second": 16.033, + "eval_steps_per_second": 2.006, + "step": 2800 + }, + { + "entropy": 0.17524497526196334, + "epoch": 7.01494396014944, + "grad_norm": 0.3330269157886505, + "learning_rate": 5.6144999125263545e-05, + "loss": 0.0895616888999939, + "mean_token_accuracy": 0.9682766932707566, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.2735865569218647, + "eval_loss": 0.768479585647583, + "eval_mean_token_accuracy": 0.8503459383581959, + "eval_num_tokens": 6583767.0, + "eval_runtime": 85.7162, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.007, + "step": 2820 + }, + { + "entropy": 0.1403565663844347, + "epoch": 7.064757160647572, + "grad_norm": 0.35613498091697693, + "learning_rate": 5.4456361758874235e-05, + "loss": 0.07551313638687134, + "mean_token_accuracy": 0.9739301167428493, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.25941789089593775, + "eval_loss": 0.8209511637687683, + "eval_mean_token_accuracy": 0.8505055855873019, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.0943, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 2840 + }, + { + "entropy": 0.13500106502324344, + "epoch": 7.114570361145703, + "grad_norm": 0.34418627619743347, + "learning_rate": 5.2785422495482234e-05, + "loss": 0.07293946146965027, + "mean_token_accuracy": 0.9747208289802074, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.26482899772912954, + "eval_loss": 0.798904538154602, + "eval_mean_token_accuracy": 0.8511530233677044, + "eval_num_tokens": 6672946.0, + "eval_runtime": 85.7915, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.005, + "step": 2860 + }, + { + "entropy": 0.13127502552233636, + "epoch": 7.164383561643835, + "grad_norm": 0.4638441503047943, + "learning_rate": 5.113268526757892e-05, + "loss": 0.07121461629867554, + "mean_token_accuracy": 0.9756786689162255, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2645381211714689, + "eval_loss": 0.809101939201355, + "eval_mean_token_accuracy": 0.8514727898115335, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.84, + "eval_samples_per_second": 16.018, + "eval_steps_per_second": 2.004, + "step": 2880 + }, + { + "entropy": 0.1331390908919275, + "epoch": 7.214196762141968, + "grad_norm": 0.40206775069236755, + "learning_rate": 4.949864851817007e-05, + "loss": 0.07188264131546021, + "mean_token_accuracy": 0.9755406074225903, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.26244733283339544, + "eval_loss": 0.8143188953399658, + "eval_mean_token_accuracy": 0.8514358189909957, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.8546, + "eval_samples_per_second": 16.015, + "eval_steps_per_second": 2.003, + "step": 2900 + }, + { + "entropy": 0.13647331558167936, + "epoch": 7.2640099626401, + "grad_norm": 0.26405787467956543, + "learning_rate": 4.788380505045224e-05, + "loss": 0.07412450313568116, + "mean_token_accuracy": 0.9744274213910102, + "num_tokens": 6809678.0, + "step": 2920 + }, + { + "epoch": 7.2640099626401, + "eval_entropy": 0.2626111418182074, + "eval_loss": 0.8111525177955627, + "eval_mean_token_accuracy": 0.8512121695418691, + "eval_num_tokens": 6809678.0, + "eval_runtime": 85.9626, + "eval_samples_per_second": 15.995, + "eval_steps_per_second": 2.001, + "step": 2920 + }, + { + "entropy": 0.12644002586603165, + "epoch": 7.313823163138232, + "grad_norm": 0.27514681220054626, + "learning_rate": 4.6288641879189884e-05, + "loss": 0.06807711124420165, + "mean_token_accuracy": 0.9760703906416893, + "num_tokens": 6860750.0, + "step": 2940 + }, + { + "epoch": 7.313823163138232, + "eval_entropy": 0.26096762734097106, + "eval_loss": 0.8184595108032227, + "eval_mean_token_accuracy": 0.8501476153384807, + "eval_num_tokens": 6860750.0, + "eval_runtime": 85.9521, + "eval_samples_per_second": 15.997, + "eval_steps_per_second": 2.001, + "step": 2940 + }, + { + "entropy": 0.13920630998909472, + "epoch": 7.363636363636363, + "grad_norm": 0.23584705591201782, + "learning_rate": 4.4713640083838604e-05, + "loss": 0.07301607131958007, + "mean_token_accuracy": 0.9745715200901032, + "num_tokens": 6907092.0, + "step": 2960 + }, + { + "epoch": 7.363636363636363, + "eval_entropy": 0.2612536767021168, + "eval_loss": 0.8116245269775391, + "eval_mean_token_accuracy": 0.8510967350976412, + "eval_num_tokens": 6907092.0, + "eval_runtime": 85.6373, + "eval_samples_per_second": 16.056, + "eval_steps_per_second": 2.008, + "step": 2960 + }, + { + "entropy": 0.1349492883309722, + "epoch": 7.4134495641344955, + "grad_norm": 0.24552719295024872, + "learning_rate": 4.315927466345791e-05, + "loss": 0.07397544980049134, + "mean_token_accuracy": 0.9745095103979111, + "num_tokens": 6952700.0, + "step": 2980 + }, + { + "epoch": 7.4134495641344955, + "eval_entropy": 0.25796533306670744, + "eval_loss": 0.8266491293907166, + "eval_mean_token_accuracy": 0.8511653857868772, + "eval_num_tokens": 6952700.0, + "eval_runtime": 85.7462, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.006, + "step": 2980 + }, + { + "entropy": 0.14479175000451505, + "epoch": 7.463262764632628, + "grad_norm": 0.2846072018146515, + "learning_rate": 4.162601439345814e-05, + "loss": 0.07544798254966736, + "mean_token_accuracy": 0.9727819666266442, + "num_tokens": 6996430.0, + "step": 3000 + }, + { + "epoch": 7.463262764632628, + "eval_entropy": 0.2584348309698493, + "eval_loss": 0.8253348469734192, + "eval_mean_token_accuracy": 0.8511569815319638, + "eval_num_tokens": 6996430.0, + "eval_runtime": 86.2984, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 3000 + }, + { + "entropy": 0.14114196319133043, + "epoch": 7.51307596513076, + "grad_norm": 0.407966285943985, + "learning_rate": 4.011432168422419e-05, + "loss": 0.0736398994922638, + "mean_token_accuracy": 0.9741654269397259, + "num_tokens": 7042038.0, + "step": 3020 + }, + { + "epoch": 7.51307596513076, + "eval_entropy": 0.25232676260693127, + "eval_loss": 0.8296052813529968, + "eval_mean_token_accuracy": 0.8523298349491385, + "eval_num_tokens": 7042038.0, + "eval_runtime": 85.8445, + "eval_samples_per_second": 16.017, + "eval_steps_per_second": 2.004, + "step": 3020 + }, + { + "entropy": 0.1353456223383546, + "epoch": 7.562889165628892, + "grad_norm": 0.2712634801864624, + "learning_rate": 3.8624652441658684e-05, + "loss": 0.07362412214279175, + "mean_token_accuracy": 0.9747945807874203, + "num_tokens": 7089390.0, + "step": 3040 + }, + { + "epoch": 7.562889165628892, + "eval_entropy": 0.2579477243991785, + "eval_loss": 0.8274564743041992, + "eval_mean_token_accuracy": 0.8517705212498821, + "eval_num_tokens": 7089390.0, + "eval_runtime": 85.8222, + "eval_samples_per_second": 16.022, + "eval_steps_per_second": 2.004, + "step": 3040 + }, + { + "entropy": 0.1296080862637609, + "epoch": 7.6127023661270234, + "grad_norm": 0.2371893972158432, + "learning_rate": 3.715745592968707e-05, + "loss": 0.06971035599708557, + "mean_token_accuracy": 0.9759043246507645, + "num_tokens": 7138002.0, + "step": 3060 + }, + { + "epoch": 7.6127023661270234, + "eval_entropy": 0.25391967083479083, + "eval_loss": 0.8197130560874939, + "eval_mean_token_accuracy": 0.8522267875283264, + "eval_num_tokens": 7138002.0, + "eval_runtime": 85.8796, + "eval_samples_per_second": 16.011, + "eval_steps_per_second": 2.003, + "step": 3060 + }, + { + "entropy": 0.1311203008517623, + "epoch": 7.662515566625156, + "grad_norm": 0.22499267756938934, + "learning_rate": 3.5713174634765967e-05, + "loss": 0.07176244258880615, + "mean_token_accuracy": 0.9754939571022987, + "num_tokens": 7185520.0, + "step": 3080 + }, + { + "epoch": 7.662515566625156, + "eval_entropy": 0.2526215241225653, + "eval_loss": 0.8265154361724854, + "eval_mean_token_accuracy": 0.8519952584837758, + "eval_num_tokens": 7185520.0, + "eval_runtime": 85.8746, + "eval_samples_per_second": 16.012, + "eval_steps_per_second": 2.003, + "step": 3080 + }, + { + "entropy": 0.13420484317466616, + "epoch": 7.712328767123288, + "grad_norm": 0.2398064285516739, + "learning_rate": 3.4292244132434866e-05, + "loss": 0.07559212446212768, + "mean_token_accuracy": 0.9743142127990723, + "num_tokens": 7232170.0, + "step": 3100 + }, + { + "epoch": 7.712328767123288, + "eval_entropy": 0.2484562756537005, + "eval_loss": 0.8312150239944458, + "eval_mean_token_accuracy": 0.8528405119513356, + "eval_num_tokens": 7232170.0, + "eval_runtime": 85.7896, + "eval_samples_per_second": 16.028, + "eval_steps_per_second": 2.005, + "step": 3100 + }, + { + "entropy": 0.11965563679113984, + "epoch": 7.76214196762142, + "grad_norm": 0.3408384919166565, + "learning_rate": 3.2895092955952746e-05, + "loss": 0.0661750853061676, + "mean_token_accuracy": 0.9776600524783134, + "num_tokens": 7282846.0, + "step": 3120 + }, + { + "epoch": 7.76214196762142, + "eval_entropy": 0.2522421533804993, + "eval_loss": 0.8327009677886963, + "eval_mean_token_accuracy": 0.8524222023958383, + "eval_num_tokens": 7282846.0, + "eval_runtime": 86.1769, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 1.996, + "step": 3120 + }, + { + "entropy": 0.13388084415346385, + "epoch": 7.811955168119551, + "grad_norm": 0.35418516397476196, + "learning_rate": 3.152214246705829e-05, + "loss": 0.07149899601936341, + "mean_token_accuracy": 0.9747635535895824, + "num_tokens": 7331518.0, + "step": 3140 + }, + { + "epoch": 7.811955168119551, + "eval_entropy": 0.25038352296795957, + "eval_loss": 0.836457371711731, + "eval_mean_token_accuracy": 0.8526130665180295, + "eval_num_tokens": 7331518.0, + "eval_runtime": 85.6099, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.009, + "step": 3140 + }, + { + "entropy": 0.13530643959529698, + "epoch": 7.861768368617684, + "grad_norm": 0.38060539960861206, + "learning_rate": 3.017380672889291e-05, + "loss": 0.07116585969924927, + "mean_token_accuracy": 0.973284512758255, + "num_tokens": 7379056.0, + "step": 3160 + }, + { + "epoch": 7.861768368617684, + "eval_entropy": 0.255092611319797, + "eval_loss": 0.8314701914787292, + "eval_mean_token_accuracy": 0.8520913099826768, + "eval_num_tokens": 7379056.0, + "eval_runtime": 85.877, + "eval_samples_per_second": 16.011, + "eval_steps_per_second": 2.003, + "step": 3160 + }, + { + "entropy": 0.13383390177041293, + "epoch": 7.911581569115816, + "grad_norm": 0.3827536106109619, + "learning_rate": 2.8850492381124808e-05, + "loss": 0.07305437326431274, + "mean_token_accuracy": 0.9750778004527092, + "num_tokens": 7424770.0, + "step": 3180 + }, + { + "epoch": 7.911581569115816, + "eval_entropy": 0.25416371157003004, + "eval_loss": 0.8206402063369751, + "eval_mean_token_accuracy": 0.852779901651449, + "eval_num_tokens": 7424770.0, + "eval_runtime": 86.1015, + "eval_samples_per_second": 15.97, + "eval_steps_per_second": 1.998, + "step": 3180 + }, + { + "entropy": 0.1395680439658463, + "epoch": 7.961394769613948, + "grad_norm": 0.3809775412082672, + "learning_rate": 2.7552598517312256e-05, + "loss": 0.07236042022705078, + "mean_token_accuracy": 0.9731538116931915, + "num_tokens": 7470804.0, + "step": 3200 + }, + { + "epoch": 7.961394769613948, + "eval_entropy": 0.25528111975899964, + "eval_loss": 0.8230037093162537, + "eval_mean_token_accuracy": 0.8526452603035195, + "eval_num_tokens": 7470804.0, + "eval_runtime": 85.7895, + "eval_samples_per_second": 16.028, + "eval_steps_per_second": 2.005, + "step": 3200 + }, + { + "entropy": 0.12193699864049752, + "epoch": 8.009962640099626, + "grad_norm": 0.11854425817728043, + "learning_rate": 2.6280516564542205e-05, + "loss": 0.06617764234542847, + "mean_token_accuracy": 0.977179691577569, + "num_tokens": 7518110.0, + "step": 3220 + }, + { + "epoch": 8.009962640099626, + "eval_entropy": 0.25100527677771656, + "eval_loss": 0.8393343687057495, + "eval_mean_token_accuracy": 0.8522553132023922, + "eval_num_tokens": 7518110.0, + "eval_runtime": 85.8837, + "eval_samples_per_second": 16.01, + "eval_steps_per_second": 2.003, + "step": 3220 + }, + { + "entropy": 0.12788885813206435, + "epoch": 8.059775840597759, + "grad_norm": 0.16094881296157837, + "learning_rate": 2.50346301653812e-05, + "loss": 0.06274186968803405, + "mean_token_accuracy": 0.9766994707286358, + "num_tokens": 7565539.0, + "step": 3240 + }, + { + "epoch": 8.059775840597759, + "eval_entropy": 0.24409458682287571, + "eval_loss": 0.874617338180542, + "eval_mean_token_accuracy": 0.8521041180505309, + "eval_num_tokens": 7565539.0, + "eval_runtime": 86.2656, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 3240 + }, + { + "entropy": 0.12464155335910618, + "epoch": 8.10958904109589, + "grad_norm": 0.16893954575061798, + "learning_rate": 2.381531506217437e-05, + "loss": 0.06093020439147949, + "mean_token_accuracy": 0.9776258453726768, + "num_tokens": 7612578.0, + "step": 3260 + }, + { + "epoch": 8.10958904109589, + "eval_entropy": 0.24396493017326953, + "eval_loss": 0.891161322593689, + "eval_mean_token_accuracy": 0.8515338024427724, + "eval_num_tokens": 7612578.0, + "eval_runtime": 85.9061, + "eval_samples_per_second": 16.006, + "eval_steps_per_second": 2.002, + "step": 3260 + }, + { + "entropy": 0.12345920228399336, + "epoch": 8.159402241594023, + "grad_norm": 0.14332273602485657, + "learning_rate": 2.262293898372616e-05, + "loss": 0.061289966106414795, + "mean_token_accuracy": 0.9762230902910233, + "num_tokens": 7660157.0, + "step": 3280 + }, + { + "epoch": 8.159402241594023, + "eval_entropy": 0.2481445314059424, + "eval_loss": 0.8922848105430603, + "eval_mean_token_accuracy": 0.8514944855556932, + "eval_num_tokens": 7660157.0, + "eval_runtime": 85.5201, + "eval_samples_per_second": 16.078, + "eval_steps_per_second": 2.011, + "step": 3280 + }, + { + "entropy": 0.12298110066913068, + "epoch": 8.209215442092155, + "grad_norm": 0.21848882734775543, + "learning_rate": 2.1457861534398633e-05, + "loss": 0.05986443758010864, + "mean_token_accuracy": 0.9786281704902648, + "num_tokens": 7709745.0, + "step": 3300 + }, + { + "epoch": 8.209215442092155, + "eval_entropy": 0.24329388124305149, + "eval_loss": 0.9021085500717163, + "eval_mean_token_accuracy": 0.8521762625422589, + "eval_num_tokens": 7709745.0, + "eval_runtime": 85.955, + "eval_samples_per_second": 15.997, + "eval_steps_per_second": 2.001, + "step": 3300 + }, + { + "entropy": 0.13265180448070168, + "epoch": 8.259028642590286, + "grad_norm": 0.18067947030067444, + "learning_rate": 2.0320434085659692e-05, + "loss": 0.06724961400032044, + "mean_token_accuracy": 0.975098168104887, + "num_tokens": 7753571.0, + "step": 3320 + }, + { + "epoch": 8.259028642590286, + "eval_entropy": 0.2433211464694766, + "eval_loss": 0.9094350337982178, + "eval_mean_token_accuracy": 0.8520150094531304, + "eval_num_tokens": 7753571.0, + "eval_runtime": 85.7989, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.005, + "step": 3320 + }, + { + "entropy": 0.11949320202693343, + "epoch": 8.308841843088418, + "grad_norm": 0.17020289599895477, + "learning_rate": 1.9210999670114196e-05, + "loss": 0.0634455680847168, + "mean_token_accuracy": 0.9771294385194779, + "num_tokens": 7799310.0, + "step": 3340 + }, + { + "epoch": 8.308841843088418, + "eval_entropy": 0.24345201219237128, + "eval_loss": 0.9021793603897095, + "eval_mean_token_accuracy": 0.8520745697409607, + "eval_num_tokens": 7799310.0, + "eval_runtime": 86.0883, + "eval_samples_per_second": 15.972, + "eval_steps_per_second": 1.998, + "step": 3340 + }, + { + "entropy": 0.12065747743472457, + "epoch": 8.35865504358655, + "grad_norm": 0.16789060831069946, + "learning_rate": 1.8129892878049886e-05, + "loss": 0.061494195461273195, + "mean_token_accuracy": 0.9779584899544715, + "num_tokens": 7846447.0, + "step": 3360 + }, + { + "epoch": 8.35865504358655, + "eval_entropy": 0.24093415042342142, + "eval_loss": 0.9006755352020264, + "eval_mean_token_accuracy": 0.852174230786257, + "eval_num_tokens": 7846447.0, + "eval_runtime": 85.9011, + "eval_samples_per_second": 16.007, + "eval_steps_per_second": 2.002, + "step": 3360 + }, + { + "entropy": 0.13125578537583352, + "epoch": 8.408468244084682, + "grad_norm": 0.1662452220916748, + "learning_rate": 1.70774397565298e-05, + "loss": 0.06685600876808166, + "mean_token_accuracy": 0.9744067586958408, + "num_tokens": 7890283.0, + "step": 3380 + }, + { + "epoch": 8.408468244084682, + "eval_entropy": 0.24062153688350388, + "eval_loss": 0.9078915119171143, + "eval_mean_token_accuracy": 0.8523201647886011, + "eval_num_tokens": 7890283.0, + "eval_runtime": 86.0201, + "eval_samples_per_second": 15.985, + "eval_steps_per_second": 2.0, + "step": 3380 + }, + { + "entropy": 0.11986117120832204, + "epoch": 8.458281444582815, + "grad_norm": 0.19571948051452637, + "learning_rate": 1.6053957711060606e-05, + "loss": 0.06411095261573792, + "mean_token_accuracy": 0.9770627245306969, + "num_tokens": 7936518.0, + "step": 3400 + }, + { + "epoch": 8.458281444582815, + "eval_entropy": 0.24352820347561394, + "eval_loss": 0.9058943390846252, + "eval_mean_token_accuracy": 0.8519382792156797, + "eval_num_tokens": 7936518.0, + "eval_runtime": 85.966, + "eval_samples_per_second": 15.995, + "eval_steps_per_second": 2.001, + "step": 3400 + }, + { + "entropy": 0.12857897616922856, + "epoch": 8.508094645080947, + "grad_norm": 0.2609264850616455, + "learning_rate": 1.5059755409867613e-05, + "loss": 0.06473397612571716, + "mean_token_accuracy": 0.9764650195837021, + "num_tokens": 7981966.0, + "step": 3420 + }, + { + "epoch": 8.508094645080947, + "eval_entropy": 0.24032609000108962, + "eval_loss": 0.9077776074409485, + "eval_mean_token_accuracy": 0.8517829197090726, + "eval_num_tokens": 7981966.0, + "eval_runtime": 86.6059, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 3420 + }, + { + "entropy": 0.12348870886489749, + "epoch": 8.557907845579079, + "grad_norm": 0.19537609815597534, + "learning_rate": 1.409513269080473e-05, + "loss": 0.06481348872184753, + "mean_token_accuracy": 0.9769559659063816, + "num_tokens": 8028367.0, + "step": 3440 + }, + { + "epoch": 8.557907845579079, + "eval_entropy": 0.2404322574824788, + "eval_loss": 0.9057720899581909, + "eval_mean_token_accuracy": 0.8521037981953732, + "eval_num_tokens": 8028367.0, + "eval_runtime": 86.166, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.996, + "step": 3440 + }, + { + "entropy": 0.12040232736617326, + "epoch": 8.607721046077211, + "grad_norm": 0.3310582935810089, + "learning_rate": 1.3160380470927183e-05, + "loss": 0.06468871235847473, + "mean_token_accuracy": 0.9768650442361831, + "num_tokens": 8074934.0, + "step": 3460 + }, + { + "epoch": 8.607721046077211, + "eval_entropy": 0.24118655876711356, + "eval_loss": 0.9028318524360657, + "eval_mean_token_accuracy": 0.8521025340224422, + "eval_num_tokens": 8074934.0, + "eval_runtime": 85.3668, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.015, + "step": 3460 + }, + { + "entropy": 0.12328103906475008, + "epoch": 8.657534246575342, + "grad_norm": 0.12836167216300964, + "learning_rate": 1.2255780658755122e-05, + "loss": 0.06229386329650879, + "mean_token_accuracy": 0.9763277888298034, + "num_tokens": 8122775.0, + "step": 3480 + }, + { + "epoch": 8.657534246575342, + "eval_entropy": 0.24194598145956217, + "eval_loss": 0.9009329080581665, + "eval_mean_token_accuracy": 0.8521693289973015, + "eval_num_tokens": 8122775.0, + "eval_runtime": 85.9415, + "eval_samples_per_second": 15.999, + "eval_steps_per_second": 2.001, + "step": 3480 + }, + { + "entropy": 0.11321646976284683, + "epoch": 8.707347447073474, + "grad_norm": 0.15656894445419312, + "learning_rate": 1.1381606069253786e-05, + "loss": 0.05908188819885254, + "mean_token_accuracy": 0.9779504477977753, + "num_tokens": 8174307.0, + "step": 3500 + }, + { + "epoch": 8.707347447073474, + "eval_entropy": 0.24121542517528977, + "eval_loss": 0.9016091823577881, + "eval_mean_token_accuracy": 0.8521790667328724, + "eval_num_tokens": 8174307.0, + "eval_runtime": 85.7465, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.006, + "step": 3500 + }, + { + "entropy": 0.12657046681270004, + "epoch": 8.757160647571606, + "grad_norm": 0.22597502171993256, + "learning_rate": 1.053812034155629e-05, + "loss": 0.06244581937789917, + "mean_token_accuracy": 0.976795207709074, + "num_tokens": 8222808.0, + "step": 3520 + }, + { + "epoch": 8.757160647571606, + "eval_entropy": 0.23877542708502258, + "eval_loss": 0.9069110155105591, + "eval_mean_token_accuracy": 0.8522880177858264, + "eval_num_tokens": 8222808.0, + "eval_runtime": 85.7792, + "eval_samples_per_second": 16.03, + "eval_steps_per_second": 2.005, + "step": 3520 + }, + { + "entropy": 0.11422101808711886, + "epoch": 8.806973848069738, + "grad_norm": 0.21139323711395264, + "learning_rate": 9.725577859453502e-06, + "loss": 0.05988085865974426, + "mean_token_accuracy": 0.9779510758817196, + "num_tokens": 8273335.0, + "step": 3540 + }, + { + "epoch": 8.806973848069738, + "eval_entropy": 0.2393161087881687, + "eval_loss": 0.9033801555633545, + "eval_mean_token_accuracy": 0.8522614209457885, + "eval_num_tokens": 8273335.0, + "eval_runtime": 85.5594, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 3540 + }, + { + "entropy": 0.13810604228638113, + "epoch": 8.85678704856787, + "grad_norm": 0.24571993947029114, + "learning_rate": 8.944223674675537e-06, + "loss": 0.07036117911338806, + "mean_token_accuracy": 0.9734892748296261, + "num_tokens": 8315235.0, + "step": 3560 + }, + { + "epoch": 8.85678704856787, + "eval_entropy": 0.23998506947658782, + "eval_loss": 0.9009848833084106, + "eval_mean_token_accuracy": 0.8521793619837872, + "eval_num_tokens": 8315235.0, + "eval_runtime": 86.0974, + "eval_samples_per_second": 15.97, + "eval_steps_per_second": 1.998, + "step": 3560 + }, + { + "entropy": 0.14193559321574867, + "epoch": 8.906600249066003, + "grad_norm": 0.17304112017154694, + "learning_rate": 8.194293432987386e-06, + "loss": 0.07077967524528503, + "mean_token_accuracy": 0.973305893689394, + "num_tokens": 8358099.0, + "step": 3580 + }, + { + "epoch": 8.906600249066003, + "eval_entropy": 0.23883876689644748, + "eval_loss": 0.9015622138977051, + "eval_mean_token_accuracy": 0.8524864378363587, + "eval_num_tokens": 8358099.0, + "eval_runtime": 86.0089, + "eval_samples_per_second": 15.987, + "eval_steps_per_second": 2.0, + "step": 3580 + }, + { + "entropy": 0.11878943420015275, + "epoch": 8.956413449564135, + "grad_norm": 0.19075658917427063, + "learning_rate": 7.476013303121426e-06, + "loss": 0.060806107521057126, + "mean_token_accuracy": 0.9776863709092141, + "num_tokens": 8407430.0, + "step": 3600 + }, + { + "epoch": 8.956413449564135, + "eval_entropy": 0.23726526309931, + "eval_loss": 0.9060276746749878, + "eval_mean_token_accuracy": 0.8524192058762838, + "eval_num_tokens": 8407430.0, + "eval_runtime": 85.7252, + "eval_samples_per_second": 16.04, + "eval_steps_per_second": 2.006, + "step": 3600 + }, + { + "entropy": 0.1255835090787747, + "epoch": 9.004981320049813, + "grad_norm": 0.11608047038316727, + "learning_rate": 6.78959990856799e-06, + "loss": 0.06319612860679627, + "mean_token_accuracy": 0.9766685519462976, + "num_tokens": 8453175.0, + "step": 3620 + }, + { + "epoch": 9.004981320049813, + "eval_entropy": 0.2373251837006835, + "eval_loss": 0.9045722484588623, + "eval_mean_token_accuracy": 0.8525558363559634, + "eval_num_tokens": 8453175.0, + "eval_runtime": 85.7435, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.006, + "step": 3620 + }, + { + "entropy": 0.12587778437882663, + "epoch": 9.054794520547945, + "grad_norm": 0.1564614623785019, + "learning_rate": 6.135260262244683e-06, + "loss": 0.0630365788936615, + "mean_token_accuracy": 0.9777486085891723, + "num_tokens": 8497151.0, + "step": 3640 + }, + { + "epoch": 9.054794520547945, + "eval_entropy": 0.23559923721260803, + "eval_loss": 0.9120694398880005, + "eval_mean_token_accuracy": 0.8525292966947999, + "eval_num_tokens": 8497151.0, + "eval_runtime": 85.8018, + "eval_samples_per_second": 16.025, + "eval_steps_per_second": 2.005, + "step": 3640 + }, + { + "entropy": 0.12535365503281354, + "epoch": 9.104607721046078, + "grad_norm": 0.1404249221086502, + "learning_rate": 5.513191704064086e-06, + "loss": 0.060502654314041136, + "mean_token_accuracy": 0.9770058333873749, + "num_tokens": 8542996.0, + "step": 3660 + }, + { + "epoch": 9.104607721046078, + "eval_entropy": 0.23525122691725575, + "eval_loss": 0.9182237982749939, + "eval_mean_token_accuracy": 0.8524098333924316, + "eval_num_tokens": 8542996.0, + "eval_runtime": 85.9872, + "eval_samples_per_second": 15.991, + "eval_steps_per_second": 2.0, + "step": 3660 + }, + { + "entropy": 0.11330419047735632, + "epoch": 9.15442092154421, + "grad_norm": 0.15513843297958374, + "learning_rate": 4.92358184141876e-06, + "loss": 0.05822383761405945, + "mean_token_accuracy": 0.9793384782969952, + "num_tokens": 8591625.0, + "step": 3680 + }, + { + "epoch": 9.15442092154421, + "eval_entropy": 0.2353947116711805, + "eval_loss": 0.9229223132133484, + "eval_mean_token_accuracy": 0.852500357253607, + "eval_num_tokens": 8591625.0, + "eval_runtime": 86.0805, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.998, + "step": 3680 + }, + { + "entropy": 0.11830627010203898, + "epoch": 9.204234122042342, + "grad_norm": 0.1730550080537796, + "learning_rate": 4.366608492601456e-06, + "loss": 0.05860854983329773, + "mean_token_accuracy": 0.9779663667082786, + "num_tokens": 8639845.0, + "step": 3700 + }, + { + "epoch": 9.204234122042342, + "eval_entropy": 0.23567205719476522, + "eval_loss": 0.9269373416900635, + "eval_mean_token_accuracy": 0.8523658004611038, + "eval_num_tokens": 8639845.0, + "eval_runtime": 85.9809, + "eval_samples_per_second": 15.992, + "eval_steps_per_second": 2.0, + "step": 3700 + }, + { + "entropy": 0.1180900705512613, + "epoch": 9.254047322540472, + "grad_norm": 0.20909737050533295, + "learning_rate": 3.842439633177387e-06, + "loss": 0.059438884258270264, + "mean_token_accuracy": 0.9786856278777123, + "num_tokens": 8687194.0, + "step": 3720 + }, + { + "epoch": 9.254047322540472, + "eval_entropy": 0.23602714493524196, + "eval_loss": 0.9293538928031921, + "eval_mean_token_accuracy": 0.8523273440294488, + "eval_num_tokens": 8687194.0, + "eval_runtime": 85.2118, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.019, + "step": 3720 + }, + { + "entropy": 0.13156692241318524, + "epoch": 9.303860523038605, + "grad_norm": 0.12535709142684937, + "learning_rate": 3.3512333453253305e-06, + "loss": 0.06337688565254211, + "mean_token_accuracy": 0.9756712593138218, + "num_tokens": 8731721.0, + "step": 3740 + }, + { + "epoch": 9.303860523038605, + "eval_entropy": 0.23534389351343, + "eval_loss": 0.932999312877655, + "eval_mean_token_accuracy": 0.8523333925147389, + "eval_num_tokens": 8731721.0, + "eval_runtime": 85.953, + "eval_samples_per_second": 15.997, + "eval_steps_per_second": 2.001, + "step": 3740 + }, + { + "entropy": 0.12327516414225101, + "epoch": 9.353673723536737, + "grad_norm": 0.16341575980186462, + "learning_rate": 2.8931377701619306e-06, + "loss": 0.05869622826576233, + "mean_token_accuracy": 0.9784224212169648, + "num_tokens": 8778614.0, + "step": 3760 + }, + { + "epoch": 9.353673723536737, + "eval_entropy": 0.23493653622477553, + "eval_loss": 0.9358566999435425, + "eval_mean_token_accuracy": 0.8522722783476807, + "eval_num_tokens": 8778614.0, + "eval_runtime": 85.2538, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.018, + "step": 3760 + }, + { + "entropy": 0.1134357453789562, + "epoch": 9.403486924034869, + "grad_norm": 0.23999616503715515, + "learning_rate": 2.4682910630645723e-06, + "loss": 0.057540220022201535, + "mean_token_accuracy": 0.9798057802021504, + "num_tokens": 8826551.0, + "step": 3780 + }, + { + "epoch": 9.403486924034869, + "eval_entropy": 0.23470525634150172, + "eval_loss": 0.937556266784668, + "eval_mean_token_accuracy": 0.8523351706044618, + "eval_num_tokens": 8826551.0, + "eval_runtime": 85.7764, + "eval_samples_per_second": 16.03, + "eval_steps_per_second": 2.005, + "step": 3780 + }, + { + "entropy": 0.1075570048764348, + "epoch": 9.453300124533001, + "grad_norm": 0.15417765080928802, + "learning_rate": 2.0768213520055406e-06, + "loss": 0.05581026673316956, + "mean_token_accuracy": 0.9797527104616165, + "num_tokens": 8876556.0, + "step": 3800 + }, + { + "epoch": 9.453300124533001, + "eval_entropy": 0.2347462713545145, + "eval_loss": 0.9383137226104736, + "eval_mean_token_accuracy": 0.8522575324357942, + "eval_num_tokens": 8876556.0, + "eval_runtime": 85.8985, + "eval_samples_per_second": 16.007, + "eval_steps_per_second": 2.002, + "step": 3800 + }, + { + "entropy": 0.12609313456341625, + "epoch": 9.503113325031133, + "grad_norm": 0.22041426599025726, + "learning_rate": 1.7188466989102739e-06, + "loss": 0.06379218697547913, + "mean_token_accuracy": 0.9763593293726445, + "num_tokens": 8920286.0, + "step": 3820 + }, + { + "epoch": 9.503113325031133, + "eval_entropy": 0.23459658849724505, + "eval_loss": 0.9393337965011597, + "eval_mean_token_accuracy": 0.8523633532052817, + "eval_num_tokens": 8920286.0, + "eval_runtime": 85.9348, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.002, + "step": 3820 + }, + { + "entropy": 0.12149709439836442, + "epoch": 9.552926525529266, + "grad_norm": 0.16608643531799316, + "learning_rate": 1.3944750640516357e-06, + "loss": 0.06341606974601746, + "mean_token_accuracy": 0.9771503552794456, + "num_tokens": 8964464.0, + "step": 3840 + }, + { + "epoch": 9.552926525529266, + "eval_entropy": 0.2347291322468325, + "eval_loss": 0.9399036765098572, + "eval_mean_token_accuracy": 0.8523768914300341, + "eval_num_tokens": 8964464.0, + "eval_runtime": 86.1305, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.997, + "step": 3840 + }, + { + "entropy": 0.11724846777506173, + "epoch": 9.602739726027398, + "grad_norm": 0.13613300025463104, + "learning_rate": 1.103804273490497e-06, + "loss": 0.05994418263435364, + "mean_token_accuracy": 0.9778759330511093, + "num_tokens": 9010414.0, + "step": 3860 + }, + { + "epoch": 9.602739726027398, + "eval_entropy": 0.23495923337894817, + "eval_loss": 0.9400841593742371, + "eval_mean_token_accuracy": 0.8523780471363733, + "eval_num_tokens": 9010414.0, + "eval_runtime": 86.0379, + "eval_samples_per_second": 15.981, + "eval_steps_per_second": 1.999, + "step": 3860 + }, + { + "entropy": 0.12054574331268668, + "epoch": 9.65255292652553, + "grad_norm": 0.11884245276451111, + "learning_rate": 8.469219895727582e-07, + "loss": 0.05917409062385559, + "mean_token_accuracy": 0.9771256923675538, + "num_tokens": 9058053.0, + "step": 3880 + }, + { + "epoch": 9.65255292652553, + "eval_entropy": 0.23499552723626757, + "eval_loss": 0.9404177665710449, + "eval_mean_token_accuracy": 0.8523571678372317, + "eval_num_tokens": 9058053.0, + "eval_runtime": 86.0174, + "eval_samples_per_second": 15.985, + "eval_steps_per_second": 2.0, + "step": 3880 + }, + { + "entropy": 0.12163264504633844, + "epoch": 9.70236612702366, + "grad_norm": 0.18393972516059875, + "learning_rate": 6.239056844915407e-07, + "loss": 0.059613007307052615, + "mean_token_accuracy": 0.9776720523834228, + "num_tokens": 9105574.0, + "step": 3900 + }, + { + "epoch": 9.70236612702366, + "eval_entropy": 0.23491846319547918, + "eval_loss": 0.9405836462974548, + "eval_mean_token_accuracy": 0.8523543633000795, + "eval_num_tokens": 9105574.0, + "eval_runtime": 85.9519, + "eval_samples_per_second": 15.997, + "eval_steps_per_second": 2.001, + "step": 3900 + }, + { + "entropy": 0.11569633753970265, + "epoch": 9.752179327521793, + "grad_norm": 0.1553788185119629, + "learning_rate": 4.3482261692267186e-07, + "loss": 0.05866732001304627, + "mean_token_accuracy": 0.9790047742426395, + "num_tokens": 9152793.0, + "step": 3920 + }, + { + "epoch": 9.752179327521793, + "eval_entropy": 0.23489533165513082, + "eval_loss": 0.9410145878791809, + "eval_mean_token_accuracy": 0.8524025068726651, + "eval_num_tokens": 9152793.0, + "eval_runtime": 85.5221, + "eval_samples_per_second": 16.078, + "eval_steps_per_second": 2.011, + "step": 3920 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.8652538786201805e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3940/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3940/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3940/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3940/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3940/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3940/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3940/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3940/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3940/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3940/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3940/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3940/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3940/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3940/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..92891050e5b0ef9cff793212bee5605de8336ecb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3940/trainer_state.json @@ -0,0 +1,4171 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 9.801992528019925, + "eval_steps": 20, + "global_step": 3940, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + }, + { + "entropy": 0.561330484598875, + "epoch": 1.891656288916563, + "grad_norm": 0.6722865700721741, + "learning_rate": 0.0002208867897174789, + "loss": 0.499837589263916, + "mean_token_accuracy": 0.8518734864890576, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.5865232653396074, + "eval_loss": 0.5437926650047302, + "eval_mean_token_accuracy": 0.8450997017843779, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4116, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.547389242425561, + "epoch": 1.9414694894146949, + "grad_norm": 0.7935577034950256, + "learning_rate": 0.00022027119820226907, + "loss": 0.4977591514587402, + "mean_token_accuracy": 0.8539491161704064, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.5290903090391048, + "eval_loss": 0.5409526824951172, + "eval_mean_token_accuracy": 0.8497545698354411, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.7262, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 780 + }, + { + "entropy": 0.5687909748405218, + "epoch": 1.9912826899128269, + "grad_norm": 0.6180546283721924, + "learning_rate": 0.00021962329729698345, + "loss": 0.5109643459320068, + "mean_token_accuracy": 0.8521598495543004, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.5503541858390321, + "eval_loss": 0.5361555218696594, + "eval_mean_token_accuracy": 0.8510884285666221, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.3339, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 800 + }, + { + "entropy": 0.4739728841261986, + "epoch": 2.0398505603985058, + "grad_norm": 0.8058829307556152, + "learning_rate": 0.0002189432823996982, + "loss": 0.4204097747802734, + "mean_token_accuracy": 0.8728981889211215, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.5077334992414297, + "eval_loss": 0.5531114339828491, + "eval_mean_token_accuracy": 0.8489257208136625, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.4801, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.989, + "step": 820 + }, + { + "entropy": 0.4594309840351343, + "epoch": 2.0896637608966375, + "grad_norm": 0.6906896829605103, + "learning_rate": 0.0002182313585936314, + "loss": 0.4071959495544434, + "mean_token_accuracy": 0.8732857562601566, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.49850136994622474, + "eval_loss": 0.5486204624176025, + "eval_mean_token_accuracy": 0.8507991450470548, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.3364, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.4881629109382629, + "epoch": 2.1394769613947697, + "grad_norm": 0.6343470215797424, + "learning_rate": 0.0002174877405852928, + "loss": 0.41669540405273436, + "mean_token_accuracy": 0.8711295068264008, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.49155513924914734, + "eval_loss": 0.555109441280365, + "eval_mean_token_accuracy": 0.8496399400539176, + "eval_num_tokens": 2008562.0, + "eval_runtime": 86.3295, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 860 + }, + { + "entropy": 0.4648668970912695, + "epoch": 2.1892901618929015, + "grad_norm": 0.8014165163040161, + "learning_rate": 0.00021671265263973133, + "loss": 0.4110250473022461, + "mean_token_accuracy": 0.8754166305065155, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.4909258722219356, + "eval_loss": 0.5539511442184448, + "eval_mean_token_accuracy": 0.8492401502160138, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.3468, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 880 + }, + { + "entropy": 0.4824485514312983, + "epoch": 2.2391033623910337, + "grad_norm": 0.6665191054344177, + "learning_rate": 0.00021590632851289967, + "loss": 0.4181404113769531, + "mean_token_accuracy": 0.8726993151009083, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.4986876940657926, + "eval_loss": 0.547695517539978, + "eval_mean_token_accuracy": 0.8501384708770486, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.3838, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 900 + }, + { + "entropy": 0.4751896943897009, + "epoch": 2.2889165628891655, + "grad_norm": 0.81158047914505, + "learning_rate": 0.00021506901138115678, + "loss": 0.40689678192138673, + "mean_token_accuracy": 0.8745221219956875, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.507153491121392, + "eval_loss": 0.5501641631126404, + "eval_mean_token_accuracy": 0.8495670116918032, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.0912, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 920 + }, + { + "entropy": 0.4873133715242147, + "epoch": 2.3387297633872977, + "grad_norm": 0.7218056321144104, + "learning_rate": 0.0002142009537679292, + "loss": 0.42701358795166017, + "mean_token_accuracy": 0.8695114746689796, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5202612736543943, + "eval_loss": 0.5491839051246643, + "eval_mean_token_accuracy": 0.8494071208460386, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.1142, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 940 + }, + { + "entropy": 0.4762951169162989, + "epoch": 2.3885429638854294, + "grad_norm": 0.7194424867630005, + "learning_rate": 0.0002133024174675534, + "loss": 0.42299847602844237, + "mean_token_accuracy": 0.8709790132939815, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4899340462546016, + "eval_loss": 0.5522511601448059, + "eval_mean_token_accuracy": 0.8492208258357159, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.463, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 960 + }, + { + "entropy": 0.49650347977876663, + "epoch": 2.4383561643835616, + "grad_norm": 0.8406022787094116, + "learning_rate": 0.0002123736734663221, + "loss": 0.4275330066680908, + "mean_token_accuracy": 0.8670595556497573, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.49691385654515996, + "eval_loss": 0.5491269826889038, + "eval_mean_token_accuracy": 0.850309816210769, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.17, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 980 + }, + { + "entropy": 0.48843890577554705, + "epoch": 2.488169364881694, + "grad_norm": 0.9082473516464233, + "learning_rate": 0.00021141500186075868, + "loss": 0.4309722423553467, + "mean_token_accuracy": 0.8686766296625137, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5543508351195691, + "eval_loss": 0.5478800535202026, + "eval_mean_token_accuracy": 0.8478029522784921, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.3835, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 1000 + }, + { + "entropy": 0.4777219031006098, + "epoch": 2.5379825653798256, + "grad_norm": 0.7448089122772217, + "learning_rate": 0.0002104266917731438, + "loss": 0.423325252532959, + "mean_token_accuracy": 0.8706337086856365, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.49857561550168106, + "eval_loss": 0.5511948466300964, + "eval_mean_token_accuracy": 0.8502220289651737, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.5399, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.988, + "step": 1020 + }, + { + "entropy": 0.4844174191355705, + "epoch": 2.587795765877958, + "grad_norm": 0.794029176235199, + "learning_rate": 0.00020940904126432, + "loss": 0.4176753044128418, + "mean_token_accuracy": 0.873535567522049, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.485467542222766, + "eval_loss": 0.5539286732673645, + "eval_mean_token_accuracy": 0.8495475081510322, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.135, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 1.997, + "step": 1040 + }, + { + "entropy": 0.49070929251611234, + "epoch": 2.6376089663760895, + "grad_norm": 0.7558256983757019, + "learning_rate": 0.0002083623572438007, + "loss": 0.42867293357849123, + "mean_token_accuracy": 0.8696666076779366, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.490822730889154, + "eval_loss": 0.5434785485267639, + "eval_mean_token_accuracy": 0.850568296950917, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.4933, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 1060 + }, + { + "entropy": 0.47806114703416824, + "epoch": 2.6874221668742218, + "grad_norm": 0.6608979105949402, + "learning_rate": 0.00020728695537721047, + "loss": 0.4289727687835693, + "mean_token_accuracy": 0.8693130135536193, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.5285773256490397, + "eval_loss": 0.5444230437278748, + "eval_mean_token_accuracy": 0.8498796481032704, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.7091, + "eval_samples_per_second": 15.858, + "eval_steps_per_second": 1.984, + "step": 1080 + }, + { + "entropy": 0.5046216730028391, + "epoch": 2.7372353673723535, + "grad_norm": 0.8428544998168945, + "learning_rate": 0.00020618315999108454, + "loss": 0.43131070137023925, + "mean_token_accuracy": 0.8701941035687923, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.49888394738352576, + "eval_loss": 0.5459766387939453, + "eval_mean_token_accuracy": 0.8511758872935938, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.2222, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.995, + "step": 1100 + }, + { + "entropy": 0.5212558470666409, + "epoch": 2.7870485678704857, + "grad_norm": 1.129318118095398, + "learning_rate": 0.00020505130397505635, + "loss": 0.44249300956726073, + "mean_token_accuracy": 0.8654101334512234, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5179622324053631, + "eval_loss": 0.5522801280021667, + "eval_mean_token_accuracy": 0.8497019947268242, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.1903, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.996, + "step": 1120 + }, + { + "entropy": 0.4988406613469124, + "epoch": 2.8368617683686175, + "grad_norm": 0.6460545063018799, + "learning_rate": 0.00020389172868146263, + "loss": 0.4386270523071289, + "mean_token_accuracy": 0.8690383620560169, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.5042278484203094, + "eval_loss": 0.5433034300804138, + "eval_mean_token_accuracy": 0.8497674451317898, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.3028, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.993, + "step": 1140 + }, + { + "entropy": 0.4926559619605541, + "epoch": 2.8866749688667497, + "grad_norm": 0.8199329972267151, + "learning_rate": 0.00020270478382239615, + "loss": 0.4313485145568848, + "mean_token_accuracy": 0.8674727231264114, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.503873193160046, + "eval_loss": 0.5388111472129822, + "eval_mean_token_accuracy": 0.8526195034731266, + "eval_num_tokens": 2710196.0, + "eval_runtime": 86.4054, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.991, + "step": 1160 + }, + { + "entropy": 0.5020013231784105, + "epoch": 2.936488169364882, + "grad_norm": 0.7344821095466614, + "learning_rate": 0.00020149082736423723, + "loss": 0.43590536117553713, + "mean_token_accuracy": 0.8671772189438343, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5368241809828337, + "eval_loss": 0.5355703830718994, + "eval_mean_token_accuracy": 0.8517617773871089, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.2945, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1180 + }, + { + "entropy": 0.5112275708466768, + "epoch": 2.9863013698630136, + "grad_norm": 0.6951606869697571, + "learning_rate": 0.00020025022541969622, + "loss": 0.43579301834106443, + "mean_token_accuracy": 0.8641206480562686, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.5066795706055885, + "eval_loss": 0.5415249466896057, + "eval_mean_token_accuracy": 0.8493563373421513, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.5005, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.988, + "step": 1200 + }, + { + "entropy": 0.42298635305502474, + "epoch": 3.0348692403486925, + "grad_norm": 0.8201794028282166, + "learning_rate": 0.00019898335213739863, + "loss": 0.35593905448913576, + "mean_token_accuracy": 0.889238600547497, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.4584170470750609, + "eval_loss": 0.569487452507019, + "eval_mean_token_accuracy": 0.8495814173027526, + "eval_num_tokens": 2848509.0, + "eval_runtime": 86.2281, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 1220 + }, + { + "entropy": 0.37450140453875064, + "epoch": 3.0846824408468243, + "grad_norm": 0.7308394908905029, + "learning_rate": 0.0001976905895890471, + "loss": 0.307823920249939, + "mean_token_accuracy": 0.9001288741827012, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.45185995916294497, + "eval_loss": 0.5672881603240967, + "eval_mean_token_accuracy": 0.8511318519364955, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.0819, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.998, + "step": 1240 + }, + { + "entropy": 0.3887945845723152, + "epoch": 3.1344956413449565, + "grad_norm": 0.7299330830574036, + "learning_rate": 0.0001963723276541939, + "loss": 0.32047903537750244, + "mean_token_accuracy": 0.8960984498262405, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.44865354549053105, + "eval_loss": 0.5666037201881409, + "eval_mean_token_accuracy": 0.8496572649063066, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 1260 + }, + { + "entropy": 0.39677664265036583, + "epoch": 3.1843088418430883, + "grad_norm": 0.9533219933509827, + "learning_rate": 0.00019502896390265838, + "loss": 0.3253983497619629, + "mean_token_accuracy": 0.8964207418262958, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.4641980809527774, + "eval_loss": 0.5814996957778931, + "eval_mean_token_accuracy": 0.8485886212005171, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.7784, + "eval_samples_per_second": 15.845, + "eval_steps_per_second": 1.982, + "step": 1280 + }, + { + "entropy": 0.39210722744464876, + "epoch": 3.2341220423412205, + "grad_norm": 0.7447651028633118, + "learning_rate": 0.00019366090347462545, + "loss": 0.3276803970336914, + "mean_token_accuracy": 0.8930055953562259, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43595615254585135, + "eval_loss": 0.5722188353538513, + "eval_mean_token_accuracy": 0.8501105755567551, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.5271, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 1300 + }, + { + "entropy": 0.3684127271175385, + "epoch": 3.2839352428393527, + "grad_norm": 0.6934201121330261, + "learning_rate": 0.00019226855895846078, + "loss": 0.3156379222869873, + "mean_token_accuracy": 0.8976306475698947, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.4628148723480313, + "eval_loss": 0.5631352066993713, + "eval_mean_token_accuracy": 0.8504934813394103, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.3436, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 1320 + }, + { + "entropy": 0.4073401909321547, + "epoch": 3.3337484433374844, + "grad_norm": 0.9386897683143616, + "learning_rate": 0.00019085235026627994, + "loss": 0.34265310764312745, + "mean_token_accuracy": 0.8902062118053437, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.46455050623694133, + "eval_loss": 0.5586736798286438, + "eval_mean_token_accuracy": 0.8506874702004499, + "eval_num_tokens": 3132874.0, + "eval_runtime": 86.1286, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.997, + "step": 1340 + }, + { + "entropy": 0.4046429242938757, + "epoch": 3.383561643835616, + "grad_norm": 0.9633992314338684, + "learning_rate": 0.00018941270450730836, + "loss": 0.33816893100738527, + "mean_token_accuracy": 0.8927541889250279, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.46846531660750856, + "eval_loss": 0.561501681804657, + "eval_mean_token_accuracy": 0.8496256377114806, + "eval_num_tokens": 3178055.0, + "eval_runtime": 86.685, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1360 + }, + { + "entropy": 0.39872407019138334, + "epoch": 3.4333748443337484, + "grad_norm": 0.7786458730697632, + "learning_rate": 0.00018795005585907113, + "loss": 0.33342490196228025, + "mean_token_accuracy": 0.8944805048406124, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.42709505973860273, + "eval_loss": 0.5751848220825195, + "eval_mean_token_accuracy": 0.8507290447867194, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.6892, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 1380 + }, + { + "entropy": 0.3923338124528527, + "epoch": 3.4831880448318806, + "grad_norm": 0.9305956363677979, + "learning_rate": 0.0001864648454364511, + "loss": 0.33188116550445557, + "mean_token_accuracy": 0.8943330392241478, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.4386174779298694, + "eval_loss": 0.5680831074714661, + "eval_mean_token_accuracy": 0.8513129727784977, + "eval_num_tokens": 3274096.0, + "eval_runtime": 86.2671, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 1400 + }, + { + "entropy": 0.3856233984231949, + "epoch": 3.5330012453300124, + "grad_norm": 1.0362752676010132, + "learning_rate": 0.0001849575211586545, + "loss": 0.33098697662353516, + "mean_token_accuracy": 0.8961390435695649, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4574795474493226, + "eval_loss": 0.5630439519882202, + "eval_mean_token_accuracy": 0.8520988873964133, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.6035, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 1420 + }, + { + "entropy": 0.39812871962785723, + "epoch": 3.5828144458281446, + "grad_norm": 0.7807195782661438, + "learning_rate": 0.0001834285376141247, + "loss": 0.3333771228790283, + "mean_token_accuracy": 0.8930827379226685, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.4556825893909432, + "eval_loss": 0.5689062476158142, + "eval_mean_token_accuracy": 0.8507103507601937, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.1606, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.996, + "step": 1440 + }, + { + "entropy": 0.4147744856774807, + "epoch": 3.6326276463262763, + "grad_norm": 0.6429352164268494, + "learning_rate": 0.00018187835592344443, + "loss": 0.3482560873031616, + "mean_token_accuracy": 0.8910200245678425, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.46600024540757023, + "eval_loss": 0.5609709024429321, + "eval_mean_token_accuracy": 0.8491220876227977, + "eval_num_tokens": 3415600.0, + "eval_runtime": 86.8039, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1460 + }, + { + "entropy": 0.40425071083009245, + "epoch": 3.6824408468244085, + "grad_norm": 0.8613698482513428, + "learning_rate": 0.0001803074436002682, + "loss": 0.342916464805603, + "mean_token_accuracy": 0.8916418336331844, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.43855057899342026, + "eval_loss": 0.5720968246459961, + "eval_mean_token_accuracy": 0.8500823641932288, + "eval_num_tokens": 3460471.0, + "eval_runtime": 86.6746, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1480 + }, + { + "entropy": 0.39465143866837027, + "epoch": 3.7322540473225407, + "grad_norm": 0.6285189986228943, + "learning_rate": 0.0001787162744103265, + "loss": 0.3424591779708862, + "mean_token_accuracy": 0.8906558901071548, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4509461877304454, + "eval_loss": 0.5590082406997681, + "eval_mean_token_accuracy": 0.8511747371318729, + "eval_num_tokens": 3507647.0, + "eval_runtime": 86.8126, + "eval_samples_per_second": 15.839, + "eval_steps_per_second": 1.981, + "step": 1500 + }, + { + "entropy": 0.4021005939692259, + "epoch": 3.7820672478206725, + "grad_norm": 0.8821248412132263, + "learning_rate": 0.00017710532822854468, + "loss": 0.3462103843688965, + "mean_token_accuracy": 0.889109355956316, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.4502199075596277, + "eval_loss": 0.566046416759491, + "eval_mean_token_accuracy": 0.8501714208098345, + "eval_num_tokens": 3548934.0, + "eval_runtime": 86.8336, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.981, + "step": 1520 + }, + { + "entropy": 0.4017397932708263, + "epoch": 3.8318804483188043, + "grad_norm": 0.8400952816009521, + "learning_rate": 0.0001754750908943189, + "loss": 0.34890995025634763, + "mean_token_accuracy": 0.8892098367214203, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.4614003023435903, + "eval_loss": 0.5617933869361877, + "eval_mean_token_accuracy": 0.8515863616106122, + "eval_num_tokens": 3597186.0, + "eval_runtime": 86.4609, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 1540 + }, + { + "entropy": 0.4112051840871572, + "epoch": 3.8816936488169365, + "grad_norm": 0.769478440284729, + "learning_rate": 0.0001738260540649939, + "loss": 0.34711437225341796, + "mean_token_accuracy": 0.8911717928946018, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4540443811998811, + "eval_loss": 0.5576469898223877, + "eval_mean_token_accuracy": 0.8512079674144124, + "eval_num_tokens": 3646646.0, + "eval_runtime": 86.5103, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 1560 + }, + { + "entropy": 0.41105241514742374, + "epoch": 3.9315068493150687, + "grad_norm": 0.8468427062034607, + "learning_rate": 0.00017215871506758568, + "loss": 0.3433023452758789, + "mean_token_accuracy": 0.8898739732801915, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.4707539707075718, + "eval_loss": 0.5641466379165649, + "eval_mean_token_accuracy": 0.8495440957851188, + "eval_num_tokens": 3689560.0, + "eval_runtime": 86.609, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.986, + "step": 1580 + }, + { + "entropy": 0.41016379147768023, + "epoch": 3.9813200498132004, + "grad_norm": 0.7482675313949585, + "learning_rate": 0.0001704735767487946, + "loss": 0.34550890922546384, + "mean_token_accuracy": 0.8893028847873211, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.46391099864660307, + "eval_loss": 0.5593640804290771, + "eval_mean_token_accuracy": 0.8510130581467651, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.3975, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 1600 + }, + { + "entropy": 0.33167599791135544, + "epoch": 4.029887920298879, + "grad_norm": 0.9435692429542542, + "learning_rate": 0.00016877114732335337, + "loss": 0.2716026544570923, + "mean_token_accuracy": 0.9133149828666296, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.38499350005457567, + "eval_loss": 0.6298249363899231, + "eval_mean_token_accuracy": 0.8488117071778275, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.2933, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1620 + }, + { + "entropy": 0.3000166634097695, + "epoch": 4.0797011207970115, + "grad_norm": 0.8080845475196838, + "learning_rate": 0.0001670519402207569, + "loss": 0.22617182731628419, + "mean_token_accuracy": 0.9253474645316601, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.370110988703578, + "eval_loss": 0.6338461637496948, + "eval_mean_token_accuracy": 0.8485634801692741, + "eval_num_tokens": 3828830.0, + "eval_runtime": 85.9508, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.001, + "step": 1640 + }, + { + "entropy": 0.2986910421401262, + "epoch": 4.129514321295143, + "grad_norm": 0.7310900092124939, + "learning_rate": 0.0001653164739304185, + "loss": 0.22367463111877442, + "mean_token_accuracy": 0.9252275295555592, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.3944379702037157, + "eval_loss": 0.6109381914138794, + "eval_mean_token_accuracy": 0.849291454220927, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.6728, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1660 + }, + { + "entropy": 0.3095553796738386, + "epoch": 4.179327521793275, + "grad_norm": 0.7059140801429749, + "learning_rate": 0.0001635652718453007, + "loss": 0.23651680946350098, + "mean_token_accuracy": 0.9208931416273117, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.3910588648949945, + "eval_loss": 0.6104469299316406, + "eval_mean_token_accuracy": 0.8486883893262508, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7612, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.982, + "step": 1680 + }, + { + "entropy": 0.3001101028174162, + "epoch": 4.229140722291407, + "grad_norm": 0.6787802577018738, + "learning_rate": 0.00016179886210406728, + "loss": 0.23130471706390382, + "mean_token_accuracy": 0.9233332790434361, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3794369170832079, + "eval_loss": 0.6182110905647278, + "eval_mean_token_accuracy": 0.8495433777570724, + "eval_num_tokens": 3967474.0, + "eval_runtime": 85.94, + "eval_samples_per_second": 16.0, + "eval_steps_per_second": 2.001, + "step": 1700 + }, + { + "entropy": 0.3031421799212694, + "epoch": 4.2789539227895395, + "grad_norm": 0.9732038378715515, + "learning_rate": 0.0001600177774318036, + "loss": 0.2359529733657837, + "mean_token_accuracy": 0.9217648565769195, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3923123094231583, + "eval_loss": 0.6057384610176086, + "eval_mean_token_accuracy": 0.8508818288182103, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7647, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.29365369994193313, + "epoch": 4.328767123287671, + "grad_norm": 0.7681498527526855, + "learning_rate": 0.0001582225549793541, + "loss": 0.2269371747970581, + "mean_token_accuracy": 0.9245341829955578, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.4011661055129628, + "eval_loss": 0.6144486665725708, + "eval_mean_token_accuracy": 0.8480324357054955, + "eval_num_tokens": 4062594.0, + "eval_runtime": 87.1306, + "eval_samples_per_second": 15.781, + "eval_steps_per_second": 1.974, + "step": 1740 + }, + { + "entropy": 0.29396994728595016, + "epoch": 4.378580323785803, + "grad_norm": 1.0001007318496704, + "learning_rate": 0.0001564137361613248, + "loss": 0.22777395248413085, + "mean_token_accuracy": 0.9262309700250626, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38518730195802314, + "eval_loss": 0.6202630400657654, + "eval_mean_token_accuracy": 0.8493869807137999, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6616, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.3096018506214023, + "epoch": 4.428393524283935, + "grad_norm": 1.0448365211486816, + "learning_rate": 0.00015459186649280024, + "loss": 0.23696351051330566, + "mean_token_accuracy": 0.9217322513461113, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.3946371126140273, + "eval_loss": 0.6079026460647583, + "eval_mean_token_accuracy": 0.8492515852978063, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6582, + "eval_samples_per_second": 15.867, + "eval_steps_per_second": 1.985, + "step": 1780 + }, + { + "entropy": 0.32619857545942066, + "epoch": 4.478206724782067, + "grad_norm": 0.7210651636123657, + "learning_rate": 0.00015275749542482337, + "loss": 0.24651215076446534, + "mean_token_accuracy": 0.9177676141262054, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.3947690814560236, + "eval_loss": 0.6065912246704102, + "eval_mean_token_accuracy": 0.8502957744653835, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.5959, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.986, + "step": 1800 + }, + { + "entropy": 0.3193941755220294, + "epoch": 4.5280199252802, + "grad_norm": 0.8281906843185425, + "learning_rate": 0.0001509111761786888, + "loss": 0.23936262130737304, + "mean_token_accuracy": 0.9201708927750587, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38704028864239537, + "eval_loss": 0.6006569266319275, + "eval_mean_token_accuracy": 0.8502406720505205, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.8059, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1820 + }, + { + "entropy": 0.3164879363030195, + "epoch": 4.577833125778331, + "grad_norm": 0.7892968654632568, + "learning_rate": 0.00014905346557909867, + "loss": 0.24541733264923096, + "mean_token_accuracy": 0.9175932116806507, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.38861122120951497, + "eval_loss": 0.6115967631340027, + "eval_mean_token_accuracy": 0.849471275196519, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.2946, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1840 + }, + { + "entropy": 0.3051785985007882, + "epoch": 4.627646326276463, + "grad_norm": 0.8109654188156128, + "learning_rate": 0.0001471849238862319, + "loss": 0.23433220386505127, + "mean_token_accuracy": 0.9206570319831371, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.37162452295076015, + "eval_loss": 0.6184061765670776, + "eval_mean_token_accuracy": 0.8501173268223918, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.6865, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1860 + }, + { + "entropy": 0.3168198253959417, + "epoch": 4.677459526774595, + "grad_norm": 0.9512342214584351, + "learning_rate": 0.0001453061146267775, + "loss": 0.23832404613494873, + "mean_token_accuracy": 0.9197044663131237, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3845940856912801, + "eval_loss": 0.606762707233429, + "eval_mean_token_accuracy": 0.8504838194957999, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.5175, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 1880 + }, + { + "entropy": 0.30791807882487776, + "epoch": 4.7272727272727275, + "grad_norm": 0.8123113512992859, + "learning_rate": 0.00014341760442398248, + "loss": 0.2395785331726074, + "mean_token_accuracy": 0.918928150832653, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.39762327222283494, + "eval_loss": 0.5994202494621277, + "eval_mean_token_accuracy": 0.8509274201337681, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.2873, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.993, + "step": 1900 + }, + { + "entropy": 0.3021434534341097, + "epoch": 4.777085927770859, + "grad_norm": 0.731787383556366, + "learning_rate": 0.000141519962826766, + "loss": 0.23494718074798585, + "mean_token_accuracy": 0.9201403826475143, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.3827026732439219, + "eval_loss": 0.5995895862579346, + "eval_mean_token_accuracy": 0.851468373523202, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.3006, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 1920 + }, + { + "entropy": 0.31626159623265265, + "epoch": 4.826899128268991, + "grad_norm": 0.8848487138748169, + "learning_rate": 0.00013961376213795132, + "loss": 0.2439030647277832, + "mean_token_accuracy": 0.9196575872600079, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.388698436839636, + "eval_loss": 0.6000174283981323, + "eval_mean_token_accuracy": 0.8518068187458571, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.8979, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.979, + "step": 1940 + }, + { + "entropy": 0.30520407035946845, + "epoch": 4.876712328767123, + "grad_norm": 0.8532460927963257, + "learning_rate": 0.00013769957724166695, + "loss": 0.23458616733551024, + "mean_token_accuracy": 0.9221912942826748, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.38777847102908203, + "eval_loss": 0.6004981398582458, + "eval_mean_token_accuracy": 0.8516481768253238, + "eval_num_tokens": 4578167.0, + "eval_runtime": 87.0777, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.975, + "step": 1960 + }, + { + "entropy": 0.3226448342204094, + "epoch": 4.926525529265255, + "grad_norm": 0.6945561766624451, + "learning_rate": 0.0001357779854299694, + "loss": 0.24048397541046143, + "mean_token_accuracy": 0.9195300146937371, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.38581624263247777, + "eval_loss": 0.6029234528541565, + "eval_mean_token_accuracy": 0.8514213260523108, + "eval_num_tokens": 4622316.0, + "eval_runtime": 85.8729, + "eval_samples_per_second": 16.012, + "eval_steps_per_second": 2.003, + "step": 1980 + }, + { + "entropy": 0.3051655298098922, + "epoch": 4.976338729763388, + "grad_norm": 0.7976452708244324, + "learning_rate": 0.00013384956622874001, + "loss": 0.23584742546081544, + "mean_token_accuracy": 0.9216851457953453, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.37913159246361533, + "eval_loss": 0.6057604551315308, + "eval_mean_token_accuracy": 0.8525801203971686, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.1145, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 2000 + }, + { + "entropy": 0.27438195240803254, + "epoch": 5.024906600249066, + "grad_norm": 0.6729586124420166, + "learning_rate": 0.0001319149012229075, + "loss": 0.19775952100753785, + "mean_token_accuracy": 0.9339428559327737, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.3448961910813354, + "eval_loss": 0.6750120520591736, + "eval_mean_token_accuracy": 0.8487970232963562, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.1169, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 2020 + }, + { + "entropy": 0.21423916313797237, + "epoch": 5.074719800747198, + "grad_norm": 0.6934391856193542, + "learning_rate": 0.00012997457388105022, + "loss": 0.1439570426940918, + "mean_token_accuracy": 0.9528236843645572, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.3570949243771475, + "eval_loss": 0.6465504169464111, + "eval_mean_token_accuracy": 0.8490785547467166, + "eval_num_tokens": 4763269.0, + "eval_runtime": 85.9574, + "eval_samples_per_second": 15.996, + "eval_steps_per_second": 2.001, + "step": 2040 + }, + { + "entropy": 0.20838565267622472, + "epoch": 5.12453300124533, + "grad_norm": 0.7286986112594604, + "learning_rate": 0.00012802916937942972, + "loss": 0.14467307329177856, + "mean_token_accuracy": 0.950994835793972, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.3452463157821533, + "eval_loss": 0.6705958843231201, + "eval_mean_token_accuracy": 0.8490352796953778, + "eval_num_tokens": 4809047.0, + "eval_runtime": 86.228, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 2060 + }, + { + "entropy": 0.20453082229942082, + "epoch": 5.174346201743462, + "grad_norm": 0.7515555620193481, + "learning_rate": 0.00012607927442550974, + "loss": 0.13732000589370727, + "mean_token_accuracy": 0.9537357829511166, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.32431264914745506, + "eval_loss": 0.6743043065071106, + "eval_mean_token_accuracy": 0.8504878629085629, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.5948, + "eval_samples_per_second": 15.879, + "eval_steps_per_second": 1.986, + "step": 2080 + }, + { + "entropy": 0.21812320686876774, + "epoch": 5.224159402241594, + "grad_norm": 0.9093465209007263, + "learning_rate": 0.0001241254770810132, + "loss": 0.14311420917510986, + "mean_token_accuracy": 0.9514068141579628, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.33086285835435225, + "eval_loss": 0.6676449179649353, + "eval_mean_token_accuracy": 0.8505287662495015, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 2100 + }, + { + "entropy": 0.2180163251236081, + "epoch": 5.273972602739726, + "grad_norm": 0.6703007221221924, + "learning_rate": 0.00012216836658457075, + "loss": 0.14803968667984008, + "mean_token_accuracy": 0.9521303348243236, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.33162341708707255, + "eval_loss": 0.6658875942230225, + "eval_mean_token_accuracy": 0.8500757605530495, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.6296, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 2120 + }, + { + "entropy": 0.22511130161583423, + "epoch": 5.323785803237858, + "grad_norm": 0.8078880906105042, + "learning_rate": 0.00012020853317401455, + "loss": 0.15228408575057983, + "mean_token_accuracy": 0.947144789993763, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3354601170434508, + "eval_loss": 0.6677829623222351, + "eval_mean_token_accuracy": 0.8482600024273229, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.4689, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.989, + "step": 2140 + }, + { + "entropy": 0.2244176059961319, + "epoch": 5.37359900373599, + "grad_norm": 0.9636075496673584, + "learning_rate": 0.00011824656790837037, + "loss": 0.15260883569717407, + "mean_token_accuracy": 0.9471467643976211, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.3381616926297199, + "eval_loss": 0.6694412231445312, + "eval_mean_token_accuracy": 0.8482369603805764, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.4147, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 2160 + }, + { + "entropy": 0.22982364390045404, + "epoch": 5.423412204234122, + "grad_norm": 0.775401771068573, + "learning_rate": 0.00011628306248960262, + "loss": 0.15140302181243898, + "mean_token_accuracy": 0.9492553934454918, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.3305150235808173, + "eval_loss": 0.6717822551727295, + "eval_mean_token_accuracy": 0.8489849723355715, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.4728, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.989, + "step": 2180 + }, + { + "entropy": 0.21448935717344284, + "epoch": 5.473225404732254, + "grad_norm": 0.6575281023979187, + "learning_rate": 0.00011431860908416465, + "loss": 0.1452319622039795, + "mean_token_accuracy": 0.9505287684500218, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3488145174328671, + "eval_loss": 0.6612305641174316, + "eval_mean_token_accuracy": 0.8492907808963642, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6927, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 2200 + }, + { + "entropy": 0.23091202937066554, + "epoch": 5.523038605230386, + "grad_norm": 0.8909686207771301, + "learning_rate": 0.00011235380014440985, + "loss": 0.15150139331817628, + "mean_token_accuracy": 0.9497875183820724, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.3268539015810157, + "eval_loss": 0.6667542457580566, + "eval_mean_token_accuracy": 0.8499062903398691, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.4644, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 2220 + }, + { + "entropy": 0.2227974807843566, + "epoch": 5.572851805728518, + "grad_norm": 0.6180275082588196, + "learning_rate": 0.0001103892282299158, + "loss": 0.1491069197654724, + "mean_token_accuracy": 0.9488144010305405, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3346347655494546, + "eval_loss": 0.6665948629379272, + "eval_mean_token_accuracy": 0.8499961893918903, + "eval_num_tokens": 5226864.0, + "eval_runtime": 87.0548, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.976, + "step": 2240 + }, + { + "entropy": 0.21368421968072654, + "epoch": 5.62266500622665, + "grad_norm": 0.6004369258880615, + "learning_rate": 0.00010842548582877651, + "loss": 0.14485255479812623, + "mean_token_accuracy": 0.9502056457102299, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.32753298804163933, + "eval_loss": 0.6680151224136353, + "eval_mean_token_accuracy": 0.8515451086121936, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.8524, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.98, + "step": 2260 + }, + { + "entropy": 0.2103635374456644, + "epoch": 5.672478206724782, + "grad_norm": 0.699174702167511, + "learning_rate": 0.00010646316517891613, + "loss": 0.14297772645950318, + "mean_token_accuracy": 0.9512537539005279, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.32966585959806, + "eval_loss": 0.675578773021698, + "eval_mean_token_accuracy": 0.8509623023659684, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.4518, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.99, + "step": 2280 + }, + { + "entropy": 0.22516900151968003, + "epoch": 5.722291407222914, + "grad_norm": 0.6637354493141174, + "learning_rate": 0.00010450285808947797, + "loss": 0.15202572345733642, + "mean_token_accuracy": 0.9482452072203159, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3369456917740578, + "eval_loss": 0.6697061061859131, + "eval_mean_token_accuracy": 0.848603522361711, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.6371, + "eval_samples_per_second": 15.871, + "eval_steps_per_second": 1.985, + "step": 2300 + }, + { + "entropy": 0.21841065725311637, + "epoch": 5.772104607721046, + "grad_norm": 0.7940268516540527, + "learning_rate": 0.00010254515576234297, + "loss": 0.14710167646408082, + "mean_token_accuracy": 0.9493498183786869, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3237486180177955, + "eval_loss": 0.6779657602310181, + "eval_mean_token_accuracy": 0.8500715313955794, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.1826, + "eval_samples_per_second": 15.954, + "eval_steps_per_second": 1.996, + "step": 2320 + }, + { + "entropy": 0.22146204356104135, + "epoch": 5.821917808219178, + "grad_norm": 0.9234833121299744, + "learning_rate": 0.00010059064861383132, + "loss": 0.14720046520233154, + "mean_token_accuracy": 0.9493872679769992, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.32365207564692167, + "eval_loss": 0.6704005002975464, + "eval_mean_token_accuracy": 0.8507985760306203, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.5494, + "eval_samples_per_second": 15.887, + "eval_steps_per_second": 1.987, + "step": 2340 + }, + { + "entropy": 0.20934011954814197, + "epoch": 5.87173100871731, + "grad_norm": 0.5547503232955933, + "learning_rate": 9.863992609664084e-05, + "loss": 0.1464867353439331, + "mean_token_accuracy": 0.9503875687718392, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.3330401429083458, + "eval_loss": 0.6659091114997864, + "eval_mean_token_accuracy": 0.8504848906467127, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.5855, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 2360 + }, + { + "entropy": 0.21678635366261007, + "epoch": 5.921544209215442, + "grad_norm": 0.570612907409668, + "learning_rate": 9.669357652207635e-05, + "loss": 0.14821385145187377, + "mean_token_accuracy": 0.9503940217196941, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3322022325077722, + "eval_loss": 0.6722489595413208, + "eval_mean_token_accuracy": 0.8489979422369669, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.2986, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 2380 + }, + { + "entropy": 0.20932920072227718, + "epoch": 5.971357409713574, + "grad_norm": 0.7879557609558105, + "learning_rate": 9.475218688262262e-05, + "loss": 0.14675841331481934, + "mean_token_accuracy": 0.9507176131010056, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.3199348642902319, + "eval_loss": 0.6698136329650879, + "eval_mean_token_accuracy": 0.8514142130003419, + "eval_num_tokens": 5605400.0, + "eval_runtime": 85.8995, + "eval_samples_per_second": 16.007, + "eval_steps_per_second": 2.002, + "step": 2400 + }, + { + "entropy": 0.21032143919131693, + "epoch": 6.019925280199253, + "grad_norm": 0.5823076367378235, + "learning_rate": 9.281634267491569e-05, + "loss": 0.13322267532348633, + "mean_token_accuracy": 0.9550939072401096, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.30206270117399303, + "eval_loss": 0.7093168497085571, + "eval_mean_token_accuracy": 0.8500627639681794, + "eval_num_tokens": 5648968.0, + "eval_runtime": 85.8128, + "eval_samples_per_second": 16.023, + "eval_steps_per_second": 2.004, + "step": 2420 + }, + { + "entropy": 0.1534628233872354, + "epoch": 6.069738480697385, + "grad_norm": 0.710133969783783, + "learning_rate": 9.088662772316508e-05, + "loss": 0.09078952670097351, + "mean_token_accuracy": 0.9678447999060154, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.28208133101809857, + "eval_loss": 0.7636417150497437, + "eval_mean_token_accuracy": 0.8494061477655588, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9724, + "eval_samples_per_second": 15.994, + "eval_steps_per_second": 2.001, + "step": 2440 + }, + { + "entropy": 0.16151462448760867, + "epoch": 6.119551681195516, + "grad_norm": 0.5793812274932861, + "learning_rate": 8.896362400308028e-05, + "loss": 0.09545697569847107, + "mean_token_accuracy": 0.9671573750674725, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.2833245605403601, + "eval_loss": 0.7402405738830566, + "eval_mean_token_accuracy": 0.8503523728875226, + "eval_num_tokens": 5745090.0, + "eval_runtime": 85.5461, + "eval_samples_per_second": 16.073, + "eval_steps_per_second": 2.011, + "step": 2460 + }, + { + "entropy": 0.15203177919611335, + "epoch": 6.169364881693649, + "grad_norm": 0.4251123368740082, + "learning_rate": 8.704791146635483e-05, + "loss": 0.09420782327651978, + "mean_token_accuracy": 0.9677386932075024, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.28572545962971313, + "eval_loss": 0.735416829586029, + "eval_mean_token_accuracy": 0.8487084663884584, + "eval_num_tokens": 5790333.0, + "eval_runtime": 85.4801, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.012, + "step": 2480 + }, + { + "entropy": 0.15587336672469973, + "epoch": 6.219178082191781, + "grad_norm": 0.4357028007507324, + "learning_rate": 8.514006786576085e-05, + "loss": 0.09429320096969604, + "mean_token_accuracy": 0.9682952925562859, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.2859006894882335, + "eval_loss": 0.7347224950790405, + "eval_mean_token_accuracy": 0.8501905518215757, + "eval_num_tokens": 5837321.0, + "eval_runtime": 85.7578, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.006, + "step": 2500 + }, + { + "entropy": 0.15765639198943973, + "epoch": 6.268991282689913, + "grad_norm": 0.47331130504608154, + "learning_rate": 8.324066858090663e-05, + "loss": 0.09571113586425781, + "mean_token_accuracy": 0.9683481335639954, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.29231513846059176, + "eval_loss": 0.7392512559890747, + "eval_mean_token_accuracy": 0.8486633983462356, + "eval_num_tokens": 5884398.0, + "eval_runtime": 85.7846, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.005, + "step": 2520 + }, + { + "entropy": 0.16176860257983208, + "epoch": 6.318804483188045, + "grad_norm": 0.6142018437385559, + "learning_rate": 8.135028644470992e-05, + "loss": 0.09486144185066223, + "mean_token_accuracy": 0.9682316601276397, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.2851274753379267, + "eval_loss": 0.7520816922187805, + "eval_mean_token_accuracy": 0.8501113649717597, + "eval_num_tokens": 5929876.0, + "eval_runtime": 85.9425, + "eval_samples_per_second": 15.999, + "eval_steps_per_second": 2.001, + "step": 2540 + }, + { + "entropy": 0.15404034564271568, + "epoch": 6.3686176836861765, + "grad_norm": 0.6051287651062012, + "learning_rate": 7.946949157063964e-05, + "loss": 0.09280472993850708, + "mean_token_accuracy": 0.9684635892510414, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28802703563557114, + "eval_loss": 0.7439162135124207, + "eval_mean_token_accuracy": 0.8499851770872293, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.0703, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.998, + "step": 2560 + }, + { + "entropy": 0.15343588953837753, + "epoch": 6.418430884184309, + "grad_norm": 0.4823743402957916, + "learning_rate": 7.759885118077701e-05, + "loss": 0.09000591039657593, + "mean_token_accuracy": 0.9699928767979145, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2795634938533916, + "eval_loss": 0.7647850513458252, + "eval_mean_token_accuracy": 0.8503464397995971, + "eval_num_tokens": 6025380.0, + "eval_runtime": 85.8886, + "eval_samples_per_second": 16.009, + "eval_steps_per_second": 2.003, + "step": 2580 + }, + { + "entropy": 0.15740026142448188, + "epoch": 6.468244084682441, + "grad_norm": 0.5082696676254272, + "learning_rate": 7.57389294347494e-05, + "loss": 0.09191849827766418, + "mean_token_accuracy": 0.9692809768021107, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2913342311458532, + "eval_loss": 0.7518694996833801, + "eval_mean_token_accuracy": 0.8483168302580367, + "eval_num_tokens": 6073349.0, + "eval_runtime": 85.5761, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.01, + "step": 2600 + }, + { + "entropy": 0.15922069251537324, + "epoch": 6.518057285180573, + "grad_norm": 0.3995199501514435, + "learning_rate": 7.389028725958736e-05, + "loss": 0.09584367871284485, + "mean_token_accuracy": 0.9685114495456218, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.2863075934177221, + "eval_loss": 0.7539381384849548, + "eval_mean_token_accuracy": 0.8507507083027862, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.112, + "eval_samples_per_second": 15.968, + "eval_steps_per_second": 1.997, + "step": 2620 + }, + { + "entropy": 0.16197575423866512, + "epoch": 6.567870485678705, + "grad_norm": 0.534295380115509, + "learning_rate": 7.205348218055678e-05, + "loss": 0.0961170256137848, + "mean_token_accuracy": 0.9674530044198036, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.29021967315050057, + "eval_loss": 0.751198947429657, + "eval_mean_token_accuracy": 0.8509796344956686, + "eval_num_tokens": 6165523.0, + "eval_runtime": 85.7958, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.005, + "step": 2640 + }, + { + "entropy": 0.15261746793985367, + "epoch": 6.617683686176837, + "grad_norm": 0.5391237139701843, + "learning_rate": 7.022906815301673e-05, + "loss": 0.0926026999950409, + "mean_token_accuracy": 0.9695659473538398, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.29128045216202736, + "eval_loss": 0.7450292110443115, + "eval_mean_token_accuracy": 0.8498771443616512, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.3963, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 2660 + }, + { + "entropy": 0.16164180357009172, + "epoch": 6.667496886674969, + "grad_norm": 0.5767946243286133, + "learning_rate": 6.841759539535419e-05, + "loss": 0.09291981458663941, + "mean_token_accuracy": 0.9687136687338352, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2897637223088464, + "eval_loss": 0.7503410577774048, + "eval_mean_token_accuracy": 0.8503315164599308, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.0653, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.998, + "step": 2680 + }, + { + "entropy": 0.17062523355707526, + "epoch": 6.717310087173101, + "grad_norm": 0.4974168539047241, + "learning_rate": 6.661961022304563e-05, + "loss": 0.09713236689567566, + "mean_token_accuracy": 0.9661971725523472, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2765843396963075, + "eval_loss": 0.7604002356529236, + "eval_mean_token_accuracy": 0.8521115277395692, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.1676, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 2700 + }, + { + "entropy": 0.17544092936441302, + "epoch": 6.767123287671232, + "grad_norm": 0.5523537993431091, + "learning_rate": 6.483565488389582e-05, + "loss": 0.09709116220474243, + "mean_token_accuracy": 0.9650957375764847, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.27939334659035814, + "eval_loss": 0.7534670829772949, + "eval_mean_token_accuracy": 0.851230604010959, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.2913, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 2720 + }, + { + "entropy": 0.15991022661328316, + "epoch": 6.816936488169365, + "grad_norm": 0.478551983833313, + "learning_rate": 6.306626739450311e-05, + "loss": 0.09564646482467651, + "mean_token_accuracy": 0.9679084822535515, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.27878295491601146, + "eval_loss": 0.7519959211349487, + "eval_mean_token_accuracy": 0.8510654949864676, + "eval_num_tokens": 6397720.0, + "eval_runtime": 85.9109, + "eval_samples_per_second": 16.005, + "eval_steps_per_second": 2.002, + "step": 2740 + }, + { + "entropy": 0.16824879590421915, + "epoch": 6.866749688667497, + "grad_norm": 0.6681098937988281, + "learning_rate": 6.131198137800108e-05, + "loss": 0.0962279736995697, + "mean_token_accuracy": 0.966830012947321, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.2834690434121808, + "eval_loss": 0.751922070980072, + "eval_mean_token_accuracy": 0.8521237577809844, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.3618, + "eval_samples_per_second": 15.921, + "eval_steps_per_second": 1.992, + "step": 2760 + }, + { + "entropy": 0.1518704930320382, + "epoch": 6.916562889165629, + "grad_norm": 0.5201290249824524, + "learning_rate": 5.957332590312513e-05, + "loss": 0.09010660648345947, + "mean_token_accuracy": 0.9693463340401649, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.28485129617674404, + "eval_loss": 0.7452457547187805, + "eval_mean_token_accuracy": 0.8512036796919135, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.4524, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.99, + "step": 2780 + }, + { + "entropy": 0.15512610590085388, + "epoch": 6.966376089663761, + "grad_norm": 0.42802050709724426, + "learning_rate": 5.785082532465233e-05, + "loss": 0.09320432543754578, + "mean_token_accuracy": 0.9686134628951549, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.27554594526110693, + "eval_loss": 0.7644653916358948, + "eval_mean_token_accuracy": 0.8513738523389018, + "eval_num_tokens": 6540175.0, + "eval_runtime": 85.7609, + "eval_samples_per_second": 16.033, + "eval_steps_per_second": 2.006, + "step": 2800 + }, + { + "entropy": 0.17524497526196334, + "epoch": 7.01494396014944, + "grad_norm": 0.3330269157886505, + "learning_rate": 5.6144999125263545e-05, + "loss": 0.0895616888999939, + "mean_token_accuracy": 0.9682766932707566, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.2735865569218647, + "eval_loss": 0.768479585647583, + "eval_mean_token_accuracy": 0.8503459383581959, + "eval_num_tokens": 6583767.0, + "eval_runtime": 85.7162, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.007, + "step": 2820 + }, + { + "entropy": 0.1403565663844347, + "epoch": 7.064757160647572, + "grad_norm": 0.35613498091697693, + "learning_rate": 5.4456361758874235e-05, + "loss": 0.07551313638687134, + "mean_token_accuracy": 0.9739301167428493, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.25941789089593775, + "eval_loss": 0.8209511637687683, + "eval_mean_token_accuracy": 0.8505055855873019, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.0943, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 2840 + }, + { + "entropy": 0.13500106502324344, + "epoch": 7.114570361145703, + "grad_norm": 0.34418627619743347, + "learning_rate": 5.2785422495482234e-05, + "loss": 0.07293946146965027, + "mean_token_accuracy": 0.9747208289802074, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.26482899772912954, + "eval_loss": 0.798904538154602, + "eval_mean_token_accuracy": 0.8511530233677044, + "eval_num_tokens": 6672946.0, + "eval_runtime": 85.7915, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.005, + "step": 2860 + }, + { + "entropy": 0.13127502552233636, + "epoch": 7.164383561643835, + "grad_norm": 0.4638441503047943, + "learning_rate": 5.113268526757892e-05, + "loss": 0.07121461629867554, + "mean_token_accuracy": 0.9756786689162255, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2645381211714689, + "eval_loss": 0.809101939201355, + "eval_mean_token_accuracy": 0.8514727898115335, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.84, + "eval_samples_per_second": 16.018, + "eval_steps_per_second": 2.004, + "step": 2880 + }, + { + "entropy": 0.1331390908919275, + "epoch": 7.214196762141968, + "grad_norm": 0.40206775069236755, + "learning_rate": 4.949864851817007e-05, + "loss": 0.07188264131546021, + "mean_token_accuracy": 0.9755406074225903, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.26244733283339544, + "eval_loss": 0.8143188953399658, + "eval_mean_token_accuracy": 0.8514358189909957, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.8546, + "eval_samples_per_second": 16.015, + "eval_steps_per_second": 2.003, + "step": 2900 + }, + { + "entropy": 0.13647331558167936, + "epoch": 7.2640099626401, + "grad_norm": 0.26405787467956543, + "learning_rate": 4.788380505045224e-05, + "loss": 0.07412450313568116, + "mean_token_accuracy": 0.9744274213910102, + "num_tokens": 6809678.0, + "step": 2920 + }, + { + "epoch": 7.2640099626401, + "eval_entropy": 0.2626111418182074, + "eval_loss": 0.8111525177955627, + "eval_mean_token_accuracy": 0.8512121695418691, + "eval_num_tokens": 6809678.0, + "eval_runtime": 85.9626, + "eval_samples_per_second": 15.995, + "eval_steps_per_second": 2.001, + "step": 2920 + }, + { + "entropy": 0.12644002586603165, + "epoch": 7.313823163138232, + "grad_norm": 0.27514681220054626, + "learning_rate": 4.6288641879189884e-05, + "loss": 0.06807711124420165, + "mean_token_accuracy": 0.9760703906416893, + "num_tokens": 6860750.0, + "step": 2940 + }, + { + "epoch": 7.313823163138232, + "eval_entropy": 0.26096762734097106, + "eval_loss": 0.8184595108032227, + "eval_mean_token_accuracy": 0.8501476153384807, + "eval_num_tokens": 6860750.0, + "eval_runtime": 85.9521, + "eval_samples_per_second": 15.997, + "eval_steps_per_second": 2.001, + "step": 2940 + }, + { + "entropy": 0.13920630998909472, + "epoch": 7.363636363636363, + "grad_norm": 0.23584705591201782, + "learning_rate": 4.4713640083838604e-05, + "loss": 0.07301607131958007, + "mean_token_accuracy": 0.9745715200901032, + "num_tokens": 6907092.0, + "step": 2960 + }, + { + "epoch": 7.363636363636363, + "eval_entropy": 0.2612536767021168, + "eval_loss": 0.8116245269775391, + "eval_mean_token_accuracy": 0.8510967350976412, + "eval_num_tokens": 6907092.0, + "eval_runtime": 85.6373, + "eval_samples_per_second": 16.056, + "eval_steps_per_second": 2.008, + "step": 2960 + }, + { + "entropy": 0.1349492883309722, + "epoch": 7.4134495641344955, + "grad_norm": 0.24552719295024872, + "learning_rate": 4.315927466345791e-05, + "loss": 0.07397544980049134, + "mean_token_accuracy": 0.9745095103979111, + "num_tokens": 6952700.0, + "step": 2980 + }, + { + "epoch": 7.4134495641344955, + "eval_entropy": 0.25796533306670744, + "eval_loss": 0.8266491293907166, + "eval_mean_token_accuracy": 0.8511653857868772, + "eval_num_tokens": 6952700.0, + "eval_runtime": 85.7462, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.006, + "step": 2980 + }, + { + "entropy": 0.14479175000451505, + "epoch": 7.463262764632628, + "grad_norm": 0.2846072018146515, + "learning_rate": 4.162601439345814e-05, + "loss": 0.07544798254966736, + "mean_token_accuracy": 0.9727819666266442, + "num_tokens": 6996430.0, + "step": 3000 + }, + { + "epoch": 7.463262764632628, + "eval_entropy": 0.2584348309698493, + "eval_loss": 0.8253348469734192, + "eval_mean_token_accuracy": 0.8511569815319638, + "eval_num_tokens": 6996430.0, + "eval_runtime": 86.2984, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 3000 + }, + { + "entropy": 0.14114196319133043, + "epoch": 7.51307596513076, + "grad_norm": 0.407966285943985, + "learning_rate": 4.011432168422419e-05, + "loss": 0.0736398994922638, + "mean_token_accuracy": 0.9741654269397259, + "num_tokens": 7042038.0, + "step": 3020 + }, + { + "epoch": 7.51307596513076, + "eval_entropy": 0.25232676260693127, + "eval_loss": 0.8296052813529968, + "eval_mean_token_accuracy": 0.8523298349491385, + "eval_num_tokens": 7042038.0, + "eval_runtime": 85.8445, + "eval_samples_per_second": 16.017, + "eval_steps_per_second": 2.004, + "step": 3020 + }, + { + "entropy": 0.1353456223383546, + "epoch": 7.562889165628892, + "grad_norm": 0.2712634801864624, + "learning_rate": 3.8624652441658684e-05, + "loss": 0.07362412214279175, + "mean_token_accuracy": 0.9747945807874203, + "num_tokens": 7089390.0, + "step": 3040 + }, + { + "epoch": 7.562889165628892, + "eval_entropy": 0.2579477243991785, + "eval_loss": 0.8274564743041992, + "eval_mean_token_accuracy": 0.8517705212498821, + "eval_num_tokens": 7089390.0, + "eval_runtime": 85.8222, + "eval_samples_per_second": 16.022, + "eval_steps_per_second": 2.004, + "step": 3040 + }, + { + "entropy": 0.1296080862637609, + "epoch": 7.6127023661270234, + "grad_norm": 0.2371893972158432, + "learning_rate": 3.715745592968707e-05, + "loss": 0.06971035599708557, + "mean_token_accuracy": 0.9759043246507645, + "num_tokens": 7138002.0, + "step": 3060 + }, + { + "epoch": 7.6127023661270234, + "eval_entropy": 0.25391967083479083, + "eval_loss": 0.8197130560874939, + "eval_mean_token_accuracy": 0.8522267875283264, + "eval_num_tokens": 7138002.0, + "eval_runtime": 85.8796, + "eval_samples_per_second": 16.011, + "eval_steps_per_second": 2.003, + "step": 3060 + }, + { + "entropy": 0.1311203008517623, + "epoch": 7.662515566625156, + "grad_norm": 0.22499267756938934, + "learning_rate": 3.5713174634765967e-05, + "loss": 0.07176244258880615, + "mean_token_accuracy": 0.9754939571022987, + "num_tokens": 7185520.0, + "step": 3080 + }, + { + "epoch": 7.662515566625156, + "eval_entropy": 0.2526215241225653, + "eval_loss": 0.8265154361724854, + "eval_mean_token_accuracy": 0.8519952584837758, + "eval_num_tokens": 7185520.0, + "eval_runtime": 85.8746, + "eval_samples_per_second": 16.012, + "eval_steps_per_second": 2.003, + "step": 3080 + }, + { + "entropy": 0.13420484317466616, + "epoch": 7.712328767123288, + "grad_norm": 0.2398064285516739, + "learning_rate": 3.4292244132434866e-05, + "loss": 0.07559212446212768, + "mean_token_accuracy": 0.9743142127990723, + "num_tokens": 7232170.0, + "step": 3100 + }, + { + "epoch": 7.712328767123288, + "eval_entropy": 0.2484562756537005, + "eval_loss": 0.8312150239944458, + "eval_mean_token_accuracy": 0.8528405119513356, + "eval_num_tokens": 7232170.0, + "eval_runtime": 85.7896, + "eval_samples_per_second": 16.028, + "eval_steps_per_second": 2.005, + "step": 3100 + }, + { + "entropy": 0.11965563679113984, + "epoch": 7.76214196762142, + "grad_norm": 0.3408384919166565, + "learning_rate": 3.2895092955952746e-05, + "loss": 0.0661750853061676, + "mean_token_accuracy": 0.9776600524783134, + "num_tokens": 7282846.0, + "step": 3120 + }, + { + "epoch": 7.76214196762142, + "eval_entropy": 0.2522421533804993, + "eval_loss": 0.8327009677886963, + "eval_mean_token_accuracy": 0.8524222023958383, + "eval_num_tokens": 7282846.0, + "eval_runtime": 86.1769, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 1.996, + "step": 3120 + }, + { + "entropy": 0.13388084415346385, + "epoch": 7.811955168119551, + "grad_norm": 0.35418516397476196, + "learning_rate": 3.152214246705829e-05, + "loss": 0.07149899601936341, + "mean_token_accuracy": 0.9747635535895824, + "num_tokens": 7331518.0, + "step": 3140 + }, + { + "epoch": 7.811955168119551, + "eval_entropy": 0.25038352296795957, + "eval_loss": 0.836457371711731, + "eval_mean_token_accuracy": 0.8526130665180295, + "eval_num_tokens": 7331518.0, + "eval_runtime": 85.6099, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.009, + "step": 3140 + }, + { + "entropy": 0.13530643959529698, + "epoch": 7.861768368617684, + "grad_norm": 0.38060539960861206, + "learning_rate": 3.017380672889291e-05, + "loss": 0.07116585969924927, + "mean_token_accuracy": 0.973284512758255, + "num_tokens": 7379056.0, + "step": 3160 + }, + { + "epoch": 7.861768368617684, + "eval_entropy": 0.255092611319797, + "eval_loss": 0.8314701914787292, + "eval_mean_token_accuracy": 0.8520913099826768, + "eval_num_tokens": 7379056.0, + "eval_runtime": 85.877, + "eval_samples_per_second": 16.011, + "eval_steps_per_second": 2.003, + "step": 3160 + }, + { + "entropy": 0.13383390177041293, + "epoch": 7.911581569115816, + "grad_norm": 0.3827536106109619, + "learning_rate": 2.8850492381124808e-05, + "loss": 0.07305437326431274, + "mean_token_accuracy": 0.9750778004527092, + "num_tokens": 7424770.0, + "step": 3180 + }, + { + "epoch": 7.911581569115816, + "eval_entropy": 0.25416371157003004, + "eval_loss": 0.8206402063369751, + "eval_mean_token_accuracy": 0.852779901651449, + "eval_num_tokens": 7424770.0, + "eval_runtime": 86.1015, + "eval_samples_per_second": 15.97, + "eval_steps_per_second": 1.998, + "step": 3180 + }, + { + "entropy": 0.1395680439658463, + "epoch": 7.961394769613948, + "grad_norm": 0.3809775412082672, + "learning_rate": 2.7552598517312256e-05, + "loss": 0.07236042022705078, + "mean_token_accuracy": 0.9731538116931915, + "num_tokens": 7470804.0, + "step": 3200 + }, + { + "epoch": 7.961394769613948, + "eval_entropy": 0.25528111975899964, + "eval_loss": 0.8230037093162537, + "eval_mean_token_accuracy": 0.8526452603035195, + "eval_num_tokens": 7470804.0, + "eval_runtime": 85.7895, + "eval_samples_per_second": 16.028, + "eval_steps_per_second": 2.005, + "step": 3200 + }, + { + "entropy": 0.12193699864049752, + "epoch": 8.009962640099626, + "grad_norm": 0.11854425817728043, + "learning_rate": 2.6280516564542205e-05, + "loss": 0.06617764234542847, + "mean_token_accuracy": 0.977179691577569, + "num_tokens": 7518110.0, + "step": 3220 + }, + { + "epoch": 8.009962640099626, + "eval_entropy": 0.25100527677771656, + "eval_loss": 0.8393343687057495, + "eval_mean_token_accuracy": 0.8522553132023922, + "eval_num_tokens": 7518110.0, + "eval_runtime": 85.8837, + "eval_samples_per_second": 16.01, + "eval_steps_per_second": 2.003, + "step": 3220 + }, + { + "entropy": 0.12788885813206435, + "epoch": 8.059775840597759, + "grad_norm": 0.16094881296157837, + "learning_rate": 2.50346301653812e-05, + "loss": 0.06274186968803405, + "mean_token_accuracy": 0.9766994707286358, + "num_tokens": 7565539.0, + "step": 3240 + }, + { + "epoch": 8.059775840597759, + "eval_entropy": 0.24409458682287571, + "eval_loss": 0.874617338180542, + "eval_mean_token_accuracy": 0.8521041180505309, + "eval_num_tokens": 7565539.0, + "eval_runtime": 86.2656, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 3240 + }, + { + "entropy": 0.12464155335910618, + "epoch": 8.10958904109589, + "grad_norm": 0.16893954575061798, + "learning_rate": 2.381531506217437e-05, + "loss": 0.06093020439147949, + "mean_token_accuracy": 0.9776258453726768, + "num_tokens": 7612578.0, + "step": 3260 + }, + { + "epoch": 8.10958904109589, + "eval_entropy": 0.24396493017326953, + "eval_loss": 0.891161322593689, + "eval_mean_token_accuracy": 0.8515338024427724, + "eval_num_tokens": 7612578.0, + "eval_runtime": 85.9061, + "eval_samples_per_second": 16.006, + "eval_steps_per_second": 2.002, + "step": 3260 + }, + { + "entropy": 0.12345920228399336, + "epoch": 8.159402241594023, + "grad_norm": 0.14332273602485657, + "learning_rate": 2.262293898372616e-05, + "loss": 0.061289966106414795, + "mean_token_accuracy": 0.9762230902910233, + "num_tokens": 7660157.0, + "step": 3280 + }, + { + "epoch": 8.159402241594023, + "eval_entropy": 0.2481445314059424, + "eval_loss": 0.8922848105430603, + "eval_mean_token_accuracy": 0.8514944855556932, + "eval_num_tokens": 7660157.0, + "eval_runtime": 85.5201, + "eval_samples_per_second": 16.078, + "eval_steps_per_second": 2.011, + "step": 3280 + }, + { + "entropy": 0.12298110066913068, + "epoch": 8.209215442092155, + "grad_norm": 0.21848882734775543, + "learning_rate": 2.1457861534398633e-05, + "loss": 0.05986443758010864, + "mean_token_accuracy": 0.9786281704902648, + "num_tokens": 7709745.0, + "step": 3300 + }, + { + "epoch": 8.209215442092155, + "eval_entropy": 0.24329388124305149, + "eval_loss": 0.9021085500717163, + "eval_mean_token_accuracy": 0.8521762625422589, + "eval_num_tokens": 7709745.0, + "eval_runtime": 85.955, + "eval_samples_per_second": 15.997, + "eval_steps_per_second": 2.001, + "step": 3300 + }, + { + "entropy": 0.13265180448070168, + "epoch": 8.259028642590286, + "grad_norm": 0.18067947030067444, + "learning_rate": 2.0320434085659692e-05, + "loss": 0.06724961400032044, + "mean_token_accuracy": 0.975098168104887, + "num_tokens": 7753571.0, + "step": 3320 + }, + { + "epoch": 8.259028642590286, + "eval_entropy": 0.2433211464694766, + "eval_loss": 0.9094350337982178, + "eval_mean_token_accuracy": 0.8520150094531304, + "eval_num_tokens": 7753571.0, + "eval_runtime": 85.7989, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.005, + "step": 3320 + }, + { + "entropy": 0.11949320202693343, + "epoch": 8.308841843088418, + "grad_norm": 0.17020289599895477, + "learning_rate": 1.9210999670114196e-05, + "loss": 0.0634455680847168, + "mean_token_accuracy": 0.9771294385194779, + "num_tokens": 7799310.0, + "step": 3340 + }, + { + "epoch": 8.308841843088418, + "eval_entropy": 0.24345201219237128, + "eval_loss": 0.9021793603897095, + "eval_mean_token_accuracy": 0.8520745697409607, + "eval_num_tokens": 7799310.0, + "eval_runtime": 86.0883, + "eval_samples_per_second": 15.972, + "eval_steps_per_second": 1.998, + "step": 3340 + }, + { + "entropy": 0.12065747743472457, + "epoch": 8.35865504358655, + "grad_norm": 0.16789060831069946, + "learning_rate": 1.8129892878049886e-05, + "loss": 0.061494195461273195, + "mean_token_accuracy": 0.9779584899544715, + "num_tokens": 7846447.0, + "step": 3360 + }, + { + "epoch": 8.35865504358655, + "eval_entropy": 0.24093415042342142, + "eval_loss": 0.9006755352020264, + "eval_mean_token_accuracy": 0.852174230786257, + "eval_num_tokens": 7846447.0, + "eval_runtime": 85.9011, + "eval_samples_per_second": 16.007, + "eval_steps_per_second": 2.002, + "step": 3360 + }, + { + "entropy": 0.13125578537583352, + "epoch": 8.408468244084682, + "grad_norm": 0.1662452220916748, + "learning_rate": 1.70774397565298e-05, + "loss": 0.06685600876808166, + "mean_token_accuracy": 0.9744067586958408, + "num_tokens": 7890283.0, + "step": 3380 + }, + { + "epoch": 8.408468244084682, + "eval_entropy": 0.24062153688350388, + "eval_loss": 0.9078915119171143, + "eval_mean_token_accuracy": 0.8523201647886011, + "eval_num_tokens": 7890283.0, + "eval_runtime": 86.0201, + "eval_samples_per_second": 15.985, + "eval_steps_per_second": 2.0, + "step": 3380 + }, + { + "entropy": 0.11986117120832204, + "epoch": 8.458281444582815, + "grad_norm": 0.19571948051452637, + "learning_rate": 1.6053957711060606e-05, + "loss": 0.06411095261573792, + "mean_token_accuracy": 0.9770627245306969, + "num_tokens": 7936518.0, + "step": 3400 + }, + { + "epoch": 8.458281444582815, + "eval_entropy": 0.24352820347561394, + "eval_loss": 0.9058943390846252, + "eval_mean_token_accuracy": 0.8519382792156797, + "eval_num_tokens": 7936518.0, + "eval_runtime": 85.966, + "eval_samples_per_second": 15.995, + "eval_steps_per_second": 2.001, + "step": 3400 + }, + { + "entropy": 0.12857897616922856, + "epoch": 8.508094645080947, + "grad_norm": 0.2609264850616455, + "learning_rate": 1.5059755409867613e-05, + "loss": 0.06473397612571716, + "mean_token_accuracy": 0.9764650195837021, + "num_tokens": 7981966.0, + "step": 3420 + }, + { + "epoch": 8.508094645080947, + "eval_entropy": 0.24032609000108962, + "eval_loss": 0.9077776074409485, + "eval_mean_token_accuracy": 0.8517829197090726, + "eval_num_tokens": 7981966.0, + "eval_runtime": 86.6059, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 3420 + }, + { + "entropy": 0.12348870886489749, + "epoch": 8.557907845579079, + "grad_norm": 0.19537609815597534, + "learning_rate": 1.409513269080473e-05, + "loss": 0.06481348872184753, + "mean_token_accuracy": 0.9769559659063816, + "num_tokens": 8028367.0, + "step": 3440 + }, + { + "epoch": 8.557907845579079, + "eval_entropy": 0.2404322574824788, + "eval_loss": 0.9057720899581909, + "eval_mean_token_accuracy": 0.8521037981953732, + "eval_num_tokens": 8028367.0, + "eval_runtime": 86.166, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.996, + "step": 3440 + }, + { + "entropy": 0.12040232736617326, + "epoch": 8.607721046077211, + "grad_norm": 0.3310582935810089, + "learning_rate": 1.3160380470927183e-05, + "loss": 0.06468871235847473, + "mean_token_accuracy": 0.9768650442361831, + "num_tokens": 8074934.0, + "step": 3460 + }, + { + "epoch": 8.607721046077211, + "eval_entropy": 0.24118655876711356, + "eval_loss": 0.9028318524360657, + "eval_mean_token_accuracy": 0.8521025340224422, + "eval_num_tokens": 8074934.0, + "eval_runtime": 85.3668, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.015, + "step": 3460 + }, + { + "entropy": 0.12328103906475008, + "epoch": 8.657534246575342, + "grad_norm": 0.12836167216300964, + "learning_rate": 1.2255780658755122e-05, + "loss": 0.06229386329650879, + "mean_token_accuracy": 0.9763277888298034, + "num_tokens": 8122775.0, + "step": 3480 + }, + { + "epoch": 8.657534246575342, + "eval_entropy": 0.24194598145956217, + "eval_loss": 0.9009329080581665, + "eval_mean_token_accuracy": 0.8521693289973015, + "eval_num_tokens": 8122775.0, + "eval_runtime": 85.9415, + "eval_samples_per_second": 15.999, + "eval_steps_per_second": 2.001, + "step": 3480 + }, + { + "entropy": 0.11321646976284683, + "epoch": 8.707347447073474, + "grad_norm": 0.15656894445419312, + "learning_rate": 1.1381606069253786e-05, + "loss": 0.05908188819885254, + "mean_token_accuracy": 0.9779504477977753, + "num_tokens": 8174307.0, + "step": 3500 + }, + { + "epoch": 8.707347447073474, + "eval_entropy": 0.24121542517528977, + "eval_loss": 0.9016091823577881, + "eval_mean_token_accuracy": 0.8521790667328724, + "eval_num_tokens": 8174307.0, + "eval_runtime": 85.7465, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.006, + "step": 3500 + }, + { + "entropy": 0.12657046681270004, + "epoch": 8.757160647571606, + "grad_norm": 0.22597502171993256, + "learning_rate": 1.053812034155629e-05, + "loss": 0.06244581937789917, + "mean_token_accuracy": 0.976795207709074, + "num_tokens": 8222808.0, + "step": 3520 + }, + { + "epoch": 8.757160647571606, + "eval_entropy": 0.23877542708502258, + "eval_loss": 0.9069110155105591, + "eval_mean_token_accuracy": 0.8522880177858264, + "eval_num_tokens": 8222808.0, + "eval_runtime": 85.7792, + "eval_samples_per_second": 16.03, + "eval_steps_per_second": 2.005, + "step": 3520 + }, + { + "entropy": 0.11422101808711886, + "epoch": 8.806973848069738, + "grad_norm": 0.21139323711395264, + "learning_rate": 9.725577859453502e-06, + "loss": 0.05988085865974426, + "mean_token_accuracy": 0.9779510758817196, + "num_tokens": 8273335.0, + "step": 3540 + }, + { + "epoch": 8.806973848069738, + "eval_entropy": 0.2393161087881687, + "eval_loss": 0.9033801555633545, + "eval_mean_token_accuracy": 0.8522614209457885, + "eval_num_tokens": 8273335.0, + "eval_runtime": 85.5594, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 3540 + }, + { + "entropy": 0.13810604228638113, + "epoch": 8.85678704856787, + "grad_norm": 0.24571993947029114, + "learning_rate": 8.944223674675537e-06, + "loss": 0.07036117911338806, + "mean_token_accuracy": 0.9734892748296261, + "num_tokens": 8315235.0, + "step": 3560 + }, + { + "epoch": 8.85678704856787, + "eval_entropy": 0.23998506947658782, + "eval_loss": 0.9009848833084106, + "eval_mean_token_accuracy": 0.8521793619837872, + "eval_num_tokens": 8315235.0, + "eval_runtime": 86.0974, + "eval_samples_per_second": 15.97, + "eval_steps_per_second": 1.998, + "step": 3560 + }, + { + "entropy": 0.14193559321574867, + "epoch": 8.906600249066003, + "grad_norm": 0.17304112017154694, + "learning_rate": 8.194293432987386e-06, + "loss": 0.07077967524528503, + "mean_token_accuracy": 0.973305893689394, + "num_tokens": 8358099.0, + "step": 3580 + }, + { + "epoch": 8.906600249066003, + "eval_entropy": 0.23883876689644748, + "eval_loss": 0.9015622138977051, + "eval_mean_token_accuracy": 0.8524864378363587, + "eval_num_tokens": 8358099.0, + "eval_runtime": 86.0089, + "eval_samples_per_second": 15.987, + "eval_steps_per_second": 2.0, + "step": 3580 + }, + { + "entropy": 0.11878943420015275, + "epoch": 8.956413449564135, + "grad_norm": 0.19075658917427063, + "learning_rate": 7.476013303121426e-06, + "loss": 0.060806107521057126, + "mean_token_accuracy": 0.9776863709092141, + "num_tokens": 8407430.0, + "step": 3600 + }, + { + "epoch": 8.956413449564135, + "eval_entropy": 0.23726526309931, + "eval_loss": 0.9060276746749878, + "eval_mean_token_accuracy": 0.8524192058762838, + "eval_num_tokens": 8407430.0, + "eval_runtime": 85.7252, + "eval_samples_per_second": 16.04, + "eval_steps_per_second": 2.006, + "step": 3600 + }, + { + "entropy": 0.1255835090787747, + "epoch": 9.004981320049813, + "grad_norm": 0.11608047038316727, + "learning_rate": 6.78959990856799e-06, + "loss": 0.06319612860679627, + "mean_token_accuracy": 0.9766685519462976, + "num_tokens": 8453175.0, + "step": 3620 + }, + { + "epoch": 9.004981320049813, + "eval_entropy": 0.2373251837006835, + "eval_loss": 0.9045722484588623, + "eval_mean_token_accuracy": 0.8525558363559634, + "eval_num_tokens": 8453175.0, + "eval_runtime": 85.7435, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.006, + "step": 3620 + }, + { + "entropy": 0.12587778437882663, + "epoch": 9.054794520547945, + "grad_norm": 0.1564614623785019, + "learning_rate": 6.135260262244683e-06, + "loss": 0.0630365788936615, + "mean_token_accuracy": 0.9777486085891723, + "num_tokens": 8497151.0, + "step": 3640 + }, + { + "epoch": 9.054794520547945, + "eval_entropy": 0.23559923721260803, + "eval_loss": 0.9120694398880005, + "eval_mean_token_accuracy": 0.8525292966947999, + "eval_num_tokens": 8497151.0, + "eval_runtime": 85.8018, + "eval_samples_per_second": 16.025, + "eval_steps_per_second": 2.005, + "step": 3640 + }, + { + "entropy": 0.12535365503281354, + "epoch": 9.104607721046078, + "grad_norm": 0.1404249221086502, + "learning_rate": 5.513191704064086e-06, + "loss": 0.060502654314041136, + "mean_token_accuracy": 0.9770058333873749, + "num_tokens": 8542996.0, + "step": 3660 + }, + { + "epoch": 9.104607721046078, + "eval_entropy": 0.23525122691725575, + "eval_loss": 0.9182237982749939, + "eval_mean_token_accuracy": 0.8524098333924316, + "eval_num_tokens": 8542996.0, + "eval_runtime": 85.9872, + "eval_samples_per_second": 15.991, + "eval_steps_per_second": 2.0, + "step": 3660 + }, + { + "entropy": 0.11330419047735632, + "epoch": 9.15442092154421, + "grad_norm": 0.15513843297958374, + "learning_rate": 4.92358184141876e-06, + "loss": 0.05822383761405945, + "mean_token_accuracy": 0.9793384782969952, + "num_tokens": 8591625.0, + "step": 3680 + }, + { + "epoch": 9.15442092154421, + "eval_entropy": 0.2353947116711805, + "eval_loss": 0.9229223132133484, + "eval_mean_token_accuracy": 0.852500357253607, + "eval_num_tokens": 8591625.0, + "eval_runtime": 86.0805, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.998, + "step": 3680 + }, + { + "entropy": 0.11830627010203898, + "epoch": 9.204234122042342, + "grad_norm": 0.1730550080537796, + "learning_rate": 4.366608492601456e-06, + "loss": 0.05860854983329773, + "mean_token_accuracy": 0.9779663667082786, + "num_tokens": 8639845.0, + "step": 3700 + }, + { + "epoch": 9.204234122042342, + "eval_entropy": 0.23567205719476522, + "eval_loss": 0.9269373416900635, + "eval_mean_token_accuracy": 0.8523658004611038, + "eval_num_tokens": 8639845.0, + "eval_runtime": 85.9809, + "eval_samples_per_second": 15.992, + "eval_steps_per_second": 2.0, + "step": 3700 + }, + { + "entropy": 0.1180900705512613, + "epoch": 9.254047322540472, + "grad_norm": 0.20909737050533295, + "learning_rate": 3.842439633177387e-06, + "loss": 0.059438884258270264, + "mean_token_accuracy": 0.9786856278777123, + "num_tokens": 8687194.0, + "step": 3720 + }, + { + "epoch": 9.254047322540472, + "eval_entropy": 0.23602714493524196, + "eval_loss": 0.9293538928031921, + "eval_mean_token_accuracy": 0.8523273440294488, + "eval_num_tokens": 8687194.0, + "eval_runtime": 85.2118, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.019, + "step": 3720 + }, + { + "entropy": 0.13156692241318524, + "epoch": 9.303860523038605, + "grad_norm": 0.12535709142684937, + "learning_rate": 3.3512333453253305e-06, + "loss": 0.06337688565254211, + "mean_token_accuracy": 0.9756712593138218, + "num_tokens": 8731721.0, + "step": 3740 + }, + { + "epoch": 9.303860523038605, + "eval_entropy": 0.23534389351343, + "eval_loss": 0.932999312877655, + "eval_mean_token_accuracy": 0.8523333925147389, + "eval_num_tokens": 8731721.0, + "eval_runtime": 85.953, + "eval_samples_per_second": 15.997, + "eval_steps_per_second": 2.001, + "step": 3740 + }, + { + "entropy": 0.12327516414225101, + "epoch": 9.353673723536737, + "grad_norm": 0.16341575980186462, + "learning_rate": 2.8931377701619306e-06, + "loss": 0.05869622826576233, + "mean_token_accuracy": 0.9784224212169648, + "num_tokens": 8778614.0, + "step": 3760 + }, + { + "epoch": 9.353673723536737, + "eval_entropy": 0.23493653622477553, + "eval_loss": 0.9358566999435425, + "eval_mean_token_accuracy": 0.8522722783476807, + "eval_num_tokens": 8778614.0, + "eval_runtime": 85.2538, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.018, + "step": 3760 + }, + { + "entropy": 0.1134357453789562, + "epoch": 9.403486924034869, + "grad_norm": 0.23999616503715515, + "learning_rate": 2.4682910630645723e-06, + "loss": 0.057540220022201535, + "mean_token_accuracy": 0.9798057802021504, + "num_tokens": 8826551.0, + "step": 3780 + }, + { + "epoch": 9.403486924034869, + "eval_entropy": 0.23470525634150172, + "eval_loss": 0.937556266784668, + "eval_mean_token_accuracy": 0.8523351706044618, + "eval_num_tokens": 8826551.0, + "eval_runtime": 85.7764, + "eval_samples_per_second": 16.03, + "eval_steps_per_second": 2.005, + "step": 3780 + }, + { + "entropy": 0.1075570048764348, + "epoch": 9.453300124533001, + "grad_norm": 0.15417765080928802, + "learning_rate": 2.0768213520055406e-06, + "loss": 0.05581026673316956, + "mean_token_accuracy": 0.9797527104616165, + "num_tokens": 8876556.0, + "step": 3800 + }, + { + "epoch": 9.453300124533001, + "eval_entropy": 0.2347462713545145, + "eval_loss": 0.9383137226104736, + "eval_mean_token_accuracy": 0.8522575324357942, + "eval_num_tokens": 8876556.0, + "eval_runtime": 85.8985, + "eval_samples_per_second": 16.007, + "eval_steps_per_second": 2.002, + "step": 3800 + }, + { + "entropy": 0.12609313456341625, + "epoch": 9.503113325031133, + "grad_norm": 0.22041426599025726, + "learning_rate": 1.7188466989102739e-06, + "loss": 0.06379218697547913, + "mean_token_accuracy": 0.9763593293726445, + "num_tokens": 8920286.0, + "step": 3820 + }, + { + "epoch": 9.503113325031133, + "eval_entropy": 0.23459658849724505, + "eval_loss": 0.9393337965011597, + "eval_mean_token_accuracy": 0.8523633532052817, + "eval_num_tokens": 8920286.0, + "eval_runtime": 85.9348, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.002, + "step": 3820 + }, + { + "entropy": 0.12149709439836442, + "epoch": 9.552926525529266, + "grad_norm": 0.16608643531799316, + "learning_rate": 1.3944750640516357e-06, + "loss": 0.06341606974601746, + "mean_token_accuracy": 0.9771503552794456, + "num_tokens": 8964464.0, + "step": 3840 + }, + { + "epoch": 9.552926525529266, + "eval_entropy": 0.2347291322468325, + "eval_loss": 0.9399036765098572, + "eval_mean_token_accuracy": 0.8523768914300341, + "eval_num_tokens": 8964464.0, + "eval_runtime": 86.1305, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.997, + "step": 3840 + }, + { + "entropy": 0.11724846777506173, + "epoch": 9.602739726027398, + "grad_norm": 0.13613300025463104, + "learning_rate": 1.103804273490497e-06, + "loss": 0.05994418263435364, + "mean_token_accuracy": 0.9778759330511093, + "num_tokens": 9010414.0, + "step": 3860 + }, + { + "epoch": 9.602739726027398, + "eval_entropy": 0.23495923337894817, + "eval_loss": 0.9400841593742371, + "eval_mean_token_accuracy": 0.8523780471363733, + "eval_num_tokens": 9010414.0, + "eval_runtime": 86.0379, + "eval_samples_per_second": 15.981, + "eval_steps_per_second": 1.999, + "step": 3860 + }, + { + "entropy": 0.12054574331268668, + "epoch": 9.65255292652553, + "grad_norm": 0.11884245276451111, + "learning_rate": 8.469219895727582e-07, + "loss": 0.05917409062385559, + "mean_token_accuracy": 0.9771256923675538, + "num_tokens": 9058053.0, + "step": 3880 + }, + { + "epoch": 9.65255292652553, + "eval_entropy": 0.23499552723626757, + "eval_loss": 0.9404177665710449, + "eval_mean_token_accuracy": 0.8523571678372317, + "eval_num_tokens": 9058053.0, + "eval_runtime": 86.0174, + "eval_samples_per_second": 15.985, + "eval_steps_per_second": 2.0, + "step": 3880 + }, + { + "entropy": 0.12163264504633844, + "epoch": 9.70236612702366, + "grad_norm": 0.18393972516059875, + "learning_rate": 6.239056844915407e-07, + "loss": 0.059613007307052615, + "mean_token_accuracy": 0.9776720523834228, + "num_tokens": 9105574.0, + "step": 3900 + }, + { + "epoch": 9.70236612702366, + "eval_entropy": 0.23491846319547918, + "eval_loss": 0.9405836462974548, + "eval_mean_token_accuracy": 0.8523543633000795, + "eval_num_tokens": 9105574.0, + "eval_runtime": 85.9519, + "eval_samples_per_second": 15.997, + "eval_steps_per_second": 2.001, + "step": 3900 + }, + { + "entropy": 0.11569633753970265, + "epoch": 9.752179327521793, + "grad_norm": 0.1553788185119629, + "learning_rate": 4.3482261692267186e-07, + "loss": 0.05866732001304627, + "mean_token_accuracy": 0.9790047742426395, + "num_tokens": 9152793.0, + "step": 3920 + }, + { + "epoch": 9.752179327521793, + "eval_entropy": 0.23489533165513082, + "eval_loss": 0.9410145878791809, + "eval_mean_token_accuracy": 0.8524025068726651, + "eval_num_tokens": 9152793.0, + "eval_runtime": 85.5221, + "eval_samples_per_second": 16.078, + "eval_steps_per_second": 2.011, + "step": 3920 + }, + { + "entropy": 0.12030278495512903, + "epoch": 9.801992528019925, + "grad_norm": 0.20454250276088715, + "learning_rate": 2.797298117403634e-07, + "loss": 0.061210107803344724, + "mean_token_accuracy": 0.9774218738079071, + "num_tokens": 9199382.0, + "step": 3940 + }, + { + "epoch": 9.801992528019925, + "eval_entropy": 0.2348609700105911, + "eval_loss": 0.9410302639007568, + "eval_mean_token_accuracy": 0.8523409498292346, + "eval_num_tokens": 9199382.0, + "eval_runtime": 85.9105, + "eval_samples_per_second": 16.005, + "eval_steps_per_second": 2.002, + "step": 3940 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.884385820574945e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3960/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3960/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3960/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3960/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3960/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3960/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3960/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3960/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3960/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3960/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3960/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3960/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3960/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3960/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..be74de236be8c225119e41c8504c18062294c49d --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3960/trainer_state.json @@ -0,0 +1,4192 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 9.851805728518057, + "eval_steps": 20, + "global_step": 3960, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + }, + { + "entropy": 0.561330484598875, + "epoch": 1.891656288916563, + "grad_norm": 0.6722865700721741, + "learning_rate": 0.0002208867897174789, + "loss": 0.499837589263916, + "mean_token_accuracy": 0.8518734864890576, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.5865232653396074, + "eval_loss": 0.5437926650047302, + "eval_mean_token_accuracy": 0.8450997017843779, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4116, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.547389242425561, + "epoch": 1.9414694894146949, + "grad_norm": 0.7935577034950256, + "learning_rate": 0.00022027119820226907, + "loss": 0.4977591514587402, + "mean_token_accuracy": 0.8539491161704064, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.5290903090391048, + "eval_loss": 0.5409526824951172, + "eval_mean_token_accuracy": 0.8497545698354411, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.7262, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 780 + }, + { + "entropy": 0.5687909748405218, + "epoch": 1.9912826899128269, + "grad_norm": 0.6180546283721924, + "learning_rate": 0.00021962329729698345, + "loss": 0.5109643459320068, + "mean_token_accuracy": 0.8521598495543004, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.5503541858390321, + "eval_loss": 0.5361555218696594, + "eval_mean_token_accuracy": 0.8510884285666221, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.3339, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 800 + }, + { + "entropy": 0.4739728841261986, + "epoch": 2.0398505603985058, + "grad_norm": 0.8058829307556152, + "learning_rate": 0.0002189432823996982, + "loss": 0.4204097747802734, + "mean_token_accuracy": 0.8728981889211215, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.5077334992414297, + "eval_loss": 0.5531114339828491, + "eval_mean_token_accuracy": 0.8489257208136625, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.4801, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.989, + "step": 820 + }, + { + "entropy": 0.4594309840351343, + "epoch": 2.0896637608966375, + "grad_norm": 0.6906896829605103, + "learning_rate": 0.0002182313585936314, + "loss": 0.4071959495544434, + "mean_token_accuracy": 0.8732857562601566, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.49850136994622474, + "eval_loss": 0.5486204624176025, + "eval_mean_token_accuracy": 0.8507991450470548, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.3364, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.4881629109382629, + "epoch": 2.1394769613947697, + "grad_norm": 0.6343470215797424, + "learning_rate": 0.0002174877405852928, + "loss": 0.41669540405273436, + "mean_token_accuracy": 0.8711295068264008, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.49155513924914734, + "eval_loss": 0.555109441280365, + "eval_mean_token_accuracy": 0.8496399400539176, + "eval_num_tokens": 2008562.0, + "eval_runtime": 86.3295, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 860 + }, + { + "entropy": 0.4648668970912695, + "epoch": 2.1892901618929015, + "grad_norm": 0.8014165163040161, + "learning_rate": 0.00021671265263973133, + "loss": 0.4110250473022461, + "mean_token_accuracy": 0.8754166305065155, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.4909258722219356, + "eval_loss": 0.5539511442184448, + "eval_mean_token_accuracy": 0.8492401502160138, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.3468, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 880 + }, + { + "entropy": 0.4824485514312983, + "epoch": 2.2391033623910337, + "grad_norm": 0.6665191054344177, + "learning_rate": 0.00021590632851289967, + "loss": 0.4181404113769531, + "mean_token_accuracy": 0.8726993151009083, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.4986876940657926, + "eval_loss": 0.547695517539978, + "eval_mean_token_accuracy": 0.8501384708770486, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.3838, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 900 + }, + { + "entropy": 0.4751896943897009, + "epoch": 2.2889165628891655, + "grad_norm": 0.81158047914505, + "learning_rate": 0.00021506901138115678, + "loss": 0.40689678192138673, + "mean_token_accuracy": 0.8745221219956875, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.507153491121392, + "eval_loss": 0.5501641631126404, + "eval_mean_token_accuracy": 0.8495670116918032, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.0912, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 920 + }, + { + "entropy": 0.4873133715242147, + "epoch": 2.3387297633872977, + "grad_norm": 0.7218056321144104, + "learning_rate": 0.0002142009537679292, + "loss": 0.42701358795166017, + "mean_token_accuracy": 0.8695114746689796, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5202612736543943, + "eval_loss": 0.5491839051246643, + "eval_mean_token_accuracy": 0.8494071208460386, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.1142, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 940 + }, + { + "entropy": 0.4762951169162989, + "epoch": 2.3885429638854294, + "grad_norm": 0.7194424867630005, + "learning_rate": 0.0002133024174675534, + "loss": 0.42299847602844237, + "mean_token_accuracy": 0.8709790132939815, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4899340462546016, + "eval_loss": 0.5522511601448059, + "eval_mean_token_accuracy": 0.8492208258357159, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.463, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 960 + }, + { + "entropy": 0.49650347977876663, + "epoch": 2.4383561643835616, + "grad_norm": 0.8406022787094116, + "learning_rate": 0.0002123736734663221, + "loss": 0.4275330066680908, + "mean_token_accuracy": 0.8670595556497573, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.49691385654515996, + "eval_loss": 0.5491269826889038, + "eval_mean_token_accuracy": 0.850309816210769, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.17, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 980 + }, + { + "entropy": 0.48843890577554705, + "epoch": 2.488169364881694, + "grad_norm": 0.9082473516464233, + "learning_rate": 0.00021141500186075868, + "loss": 0.4309722423553467, + "mean_token_accuracy": 0.8686766296625137, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5543508351195691, + "eval_loss": 0.5478800535202026, + "eval_mean_token_accuracy": 0.8478029522784921, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.3835, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 1000 + }, + { + "entropy": 0.4777219031006098, + "epoch": 2.5379825653798256, + "grad_norm": 0.7448089122772217, + "learning_rate": 0.0002104266917731438, + "loss": 0.423325252532959, + "mean_token_accuracy": 0.8706337086856365, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.49857561550168106, + "eval_loss": 0.5511948466300964, + "eval_mean_token_accuracy": 0.8502220289651737, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.5399, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.988, + "step": 1020 + }, + { + "entropy": 0.4844174191355705, + "epoch": 2.587795765877958, + "grad_norm": 0.794029176235199, + "learning_rate": 0.00020940904126432, + "loss": 0.4176753044128418, + "mean_token_accuracy": 0.873535567522049, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.485467542222766, + "eval_loss": 0.5539286732673645, + "eval_mean_token_accuracy": 0.8495475081510322, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.135, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 1.997, + "step": 1040 + }, + { + "entropy": 0.49070929251611234, + "epoch": 2.6376089663760895, + "grad_norm": 0.7558256983757019, + "learning_rate": 0.0002083623572438007, + "loss": 0.42867293357849123, + "mean_token_accuracy": 0.8696666076779366, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.490822730889154, + "eval_loss": 0.5434785485267639, + "eval_mean_token_accuracy": 0.850568296950917, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.4933, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 1060 + }, + { + "entropy": 0.47806114703416824, + "epoch": 2.6874221668742218, + "grad_norm": 0.6608979105949402, + "learning_rate": 0.00020728695537721047, + "loss": 0.4289727687835693, + "mean_token_accuracy": 0.8693130135536193, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.5285773256490397, + "eval_loss": 0.5444230437278748, + "eval_mean_token_accuracy": 0.8498796481032704, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.7091, + "eval_samples_per_second": 15.858, + "eval_steps_per_second": 1.984, + "step": 1080 + }, + { + "entropy": 0.5046216730028391, + "epoch": 2.7372353673723535, + "grad_norm": 0.8428544998168945, + "learning_rate": 0.00020618315999108454, + "loss": 0.43131070137023925, + "mean_token_accuracy": 0.8701941035687923, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.49888394738352576, + "eval_loss": 0.5459766387939453, + "eval_mean_token_accuracy": 0.8511758872935938, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.2222, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.995, + "step": 1100 + }, + { + "entropy": 0.5212558470666409, + "epoch": 2.7870485678704857, + "grad_norm": 1.129318118095398, + "learning_rate": 0.00020505130397505635, + "loss": 0.44249300956726073, + "mean_token_accuracy": 0.8654101334512234, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5179622324053631, + "eval_loss": 0.5522801280021667, + "eval_mean_token_accuracy": 0.8497019947268242, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.1903, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.996, + "step": 1120 + }, + { + "entropy": 0.4988406613469124, + "epoch": 2.8368617683686175, + "grad_norm": 0.6460545063018799, + "learning_rate": 0.00020389172868146263, + "loss": 0.4386270523071289, + "mean_token_accuracy": 0.8690383620560169, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.5042278484203094, + "eval_loss": 0.5433034300804138, + "eval_mean_token_accuracy": 0.8497674451317898, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.3028, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.993, + "step": 1140 + }, + { + "entropy": 0.4926559619605541, + "epoch": 2.8866749688667497, + "grad_norm": 0.8199329972267151, + "learning_rate": 0.00020270478382239615, + "loss": 0.4313485145568848, + "mean_token_accuracy": 0.8674727231264114, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.503873193160046, + "eval_loss": 0.5388111472129822, + "eval_mean_token_accuracy": 0.8526195034731266, + "eval_num_tokens": 2710196.0, + "eval_runtime": 86.4054, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.991, + "step": 1160 + }, + { + "entropy": 0.5020013231784105, + "epoch": 2.936488169364882, + "grad_norm": 0.7344821095466614, + "learning_rate": 0.00020149082736423723, + "loss": 0.43590536117553713, + "mean_token_accuracy": 0.8671772189438343, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5368241809828337, + "eval_loss": 0.5355703830718994, + "eval_mean_token_accuracy": 0.8517617773871089, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.2945, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1180 + }, + { + "entropy": 0.5112275708466768, + "epoch": 2.9863013698630136, + "grad_norm": 0.6951606869697571, + "learning_rate": 0.00020025022541969622, + "loss": 0.43579301834106443, + "mean_token_accuracy": 0.8641206480562686, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.5066795706055885, + "eval_loss": 0.5415249466896057, + "eval_mean_token_accuracy": 0.8493563373421513, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.5005, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.988, + "step": 1200 + }, + { + "entropy": 0.42298635305502474, + "epoch": 3.0348692403486925, + "grad_norm": 0.8201794028282166, + "learning_rate": 0.00019898335213739863, + "loss": 0.35593905448913576, + "mean_token_accuracy": 0.889238600547497, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.4584170470750609, + "eval_loss": 0.569487452507019, + "eval_mean_token_accuracy": 0.8495814173027526, + "eval_num_tokens": 2848509.0, + "eval_runtime": 86.2281, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 1220 + }, + { + "entropy": 0.37450140453875064, + "epoch": 3.0846824408468243, + "grad_norm": 0.7308394908905029, + "learning_rate": 0.0001976905895890471, + "loss": 0.307823920249939, + "mean_token_accuracy": 0.9001288741827012, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.45185995916294497, + "eval_loss": 0.5672881603240967, + "eval_mean_token_accuracy": 0.8511318519364955, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.0819, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.998, + "step": 1240 + }, + { + "entropy": 0.3887945845723152, + "epoch": 3.1344956413449565, + "grad_norm": 0.7299330830574036, + "learning_rate": 0.0001963723276541939, + "loss": 0.32047903537750244, + "mean_token_accuracy": 0.8960984498262405, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.44865354549053105, + "eval_loss": 0.5666037201881409, + "eval_mean_token_accuracy": 0.8496572649063066, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 1260 + }, + { + "entropy": 0.39677664265036583, + "epoch": 3.1843088418430883, + "grad_norm": 0.9533219933509827, + "learning_rate": 0.00019502896390265838, + "loss": 0.3253983497619629, + "mean_token_accuracy": 0.8964207418262958, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.4641980809527774, + "eval_loss": 0.5814996957778931, + "eval_mean_token_accuracy": 0.8485886212005171, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.7784, + "eval_samples_per_second": 15.845, + "eval_steps_per_second": 1.982, + "step": 1280 + }, + { + "entropy": 0.39210722744464876, + "epoch": 3.2341220423412205, + "grad_norm": 0.7447651028633118, + "learning_rate": 0.00019366090347462545, + "loss": 0.3276803970336914, + "mean_token_accuracy": 0.8930055953562259, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43595615254585135, + "eval_loss": 0.5722188353538513, + "eval_mean_token_accuracy": 0.8501105755567551, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.5271, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 1300 + }, + { + "entropy": 0.3684127271175385, + "epoch": 3.2839352428393527, + "grad_norm": 0.6934201121330261, + "learning_rate": 0.00019226855895846078, + "loss": 0.3156379222869873, + "mean_token_accuracy": 0.8976306475698947, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.4628148723480313, + "eval_loss": 0.5631352066993713, + "eval_mean_token_accuracy": 0.8504934813394103, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.3436, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 1320 + }, + { + "entropy": 0.4073401909321547, + "epoch": 3.3337484433374844, + "grad_norm": 0.9386897683143616, + "learning_rate": 0.00019085235026627994, + "loss": 0.34265310764312745, + "mean_token_accuracy": 0.8902062118053437, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.46455050623694133, + "eval_loss": 0.5586736798286438, + "eval_mean_token_accuracy": 0.8506874702004499, + "eval_num_tokens": 3132874.0, + "eval_runtime": 86.1286, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.997, + "step": 1340 + }, + { + "entropy": 0.4046429242938757, + "epoch": 3.383561643835616, + "grad_norm": 0.9633992314338684, + "learning_rate": 0.00018941270450730836, + "loss": 0.33816893100738527, + "mean_token_accuracy": 0.8927541889250279, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.46846531660750856, + "eval_loss": 0.561501681804657, + "eval_mean_token_accuracy": 0.8496256377114806, + "eval_num_tokens": 3178055.0, + "eval_runtime": 86.685, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1360 + }, + { + "entropy": 0.39872407019138334, + "epoch": 3.4333748443337484, + "grad_norm": 0.7786458730697632, + "learning_rate": 0.00018795005585907113, + "loss": 0.33342490196228025, + "mean_token_accuracy": 0.8944805048406124, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.42709505973860273, + "eval_loss": 0.5751848220825195, + "eval_mean_token_accuracy": 0.8507290447867194, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.6892, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 1380 + }, + { + "entropy": 0.3923338124528527, + "epoch": 3.4831880448318806, + "grad_norm": 0.9305956363677979, + "learning_rate": 0.0001864648454364511, + "loss": 0.33188116550445557, + "mean_token_accuracy": 0.8943330392241478, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.4386174779298694, + "eval_loss": 0.5680831074714661, + "eval_mean_token_accuracy": 0.8513129727784977, + "eval_num_tokens": 3274096.0, + "eval_runtime": 86.2671, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 1400 + }, + { + "entropy": 0.3856233984231949, + "epoch": 3.5330012453300124, + "grad_norm": 1.0362752676010132, + "learning_rate": 0.0001849575211586545, + "loss": 0.33098697662353516, + "mean_token_accuracy": 0.8961390435695649, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4574795474493226, + "eval_loss": 0.5630439519882202, + "eval_mean_token_accuracy": 0.8520988873964133, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.6035, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 1420 + }, + { + "entropy": 0.39812871962785723, + "epoch": 3.5828144458281446, + "grad_norm": 0.7807195782661438, + "learning_rate": 0.0001834285376141247, + "loss": 0.3333771228790283, + "mean_token_accuracy": 0.8930827379226685, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.4556825893909432, + "eval_loss": 0.5689062476158142, + "eval_mean_token_accuracy": 0.8507103507601937, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.1606, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.996, + "step": 1440 + }, + { + "entropy": 0.4147744856774807, + "epoch": 3.6326276463262763, + "grad_norm": 0.6429352164268494, + "learning_rate": 0.00018187835592344443, + "loss": 0.3482560873031616, + "mean_token_accuracy": 0.8910200245678425, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.46600024540757023, + "eval_loss": 0.5609709024429321, + "eval_mean_token_accuracy": 0.8491220876227977, + "eval_num_tokens": 3415600.0, + "eval_runtime": 86.8039, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1460 + }, + { + "entropy": 0.40425071083009245, + "epoch": 3.6824408468244085, + "grad_norm": 0.8613698482513428, + "learning_rate": 0.0001803074436002682, + "loss": 0.342916464805603, + "mean_token_accuracy": 0.8916418336331844, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.43855057899342026, + "eval_loss": 0.5720968246459961, + "eval_mean_token_accuracy": 0.8500823641932288, + "eval_num_tokens": 3460471.0, + "eval_runtime": 86.6746, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1480 + }, + { + "entropy": 0.39465143866837027, + "epoch": 3.7322540473225407, + "grad_norm": 0.6285189986228943, + "learning_rate": 0.0001787162744103265, + "loss": 0.3424591779708862, + "mean_token_accuracy": 0.8906558901071548, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4509461877304454, + "eval_loss": 0.5590082406997681, + "eval_mean_token_accuracy": 0.8511747371318729, + "eval_num_tokens": 3507647.0, + "eval_runtime": 86.8126, + "eval_samples_per_second": 15.839, + "eval_steps_per_second": 1.981, + "step": 1500 + }, + { + "entropy": 0.4021005939692259, + "epoch": 3.7820672478206725, + "grad_norm": 0.8821248412132263, + "learning_rate": 0.00017710532822854468, + "loss": 0.3462103843688965, + "mean_token_accuracy": 0.889109355956316, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.4502199075596277, + "eval_loss": 0.566046416759491, + "eval_mean_token_accuracy": 0.8501714208098345, + "eval_num_tokens": 3548934.0, + "eval_runtime": 86.8336, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.981, + "step": 1520 + }, + { + "entropy": 0.4017397932708263, + "epoch": 3.8318804483188043, + "grad_norm": 0.8400952816009521, + "learning_rate": 0.0001754750908943189, + "loss": 0.34890995025634763, + "mean_token_accuracy": 0.8892098367214203, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.4614003023435903, + "eval_loss": 0.5617933869361877, + "eval_mean_token_accuracy": 0.8515863616106122, + "eval_num_tokens": 3597186.0, + "eval_runtime": 86.4609, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 1540 + }, + { + "entropy": 0.4112051840871572, + "epoch": 3.8816936488169365, + "grad_norm": 0.769478440284729, + "learning_rate": 0.0001738260540649939, + "loss": 0.34711437225341796, + "mean_token_accuracy": 0.8911717928946018, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4540443811998811, + "eval_loss": 0.5576469898223877, + "eval_mean_token_accuracy": 0.8512079674144124, + "eval_num_tokens": 3646646.0, + "eval_runtime": 86.5103, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 1560 + }, + { + "entropy": 0.41105241514742374, + "epoch": 3.9315068493150687, + "grad_norm": 0.8468427062034607, + "learning_rate": 0.00017215871506758568, + "loss": 0.3433023452758789, + "mean_token_accuracy": 0.8898739732801915, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.4707539707075718, + "eval_loss": 0.5641466379165649, + "eval_mean_token_accuracy": 0.8495440957851188, + "eval_num_tokens": 3689560.0, + "eval_runtime": 86.609, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.986, + "step": 1580 + }, + { + "entropy": 0.41016379147768023, + "epoch": 3.9813200498132004, + "grad_norm": 0.7482675313949585, + "learning_rate": 0.0001704735767487946, + "loss": 0.34550890922546384, + "mean_token_accuracy": 0.8893028847873211, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.46391099864660307, + "eval_loss": 0.5593640804290771, + "eval_mean_token_accuracy": 0.8510130581467651, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.3975, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 1600 + }, + { + "entropy": 0.33167599791135544, + "epoch": 4.029887920298879, + "grad_norm": 0.9435692429542542, + "learning_rate": 0.00016877114732335337, + "loss": 0.2716026544570923, + "mean_token_accuracy": 0.9133149828666296, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.38499350005457567, + "eval_loss": 0.6298249363899231, + "eval_mean_token_accuracy": 0.8488117071778275, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.2933, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1620 + }, + { + "entropy": 0.3000166634097695, + "epoch": 4.0797011207970115, + "grad_norm": 0.8080845475196838, + "learning_rate": 0.0001670519402207569, + "loss": 0.22617182731628419, + "mean_token_accuracy": 0.9253474645316601, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.370110988703578, + "eval_loss": 0.6338461637496948, + "eval_mean_token_accuracy": 0.8485634801692741, + "eval_num_tokens": 3828830.0, + "eval_runtime": 85.9508, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.001, + "step": 1640 + }, + { + "entropy": 0.2986910421401262, + "epoch": 4.129514321295143, + "grad_norm": 0.7310900092124939, + "learning_rate": 0.0001653164739304185, + "loss": 0.22367463111877442, + "mean_token_accuracy": 0.9252275295555592, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.3944379702037157, + "eval_loss": 0.6109381914138794, + "eval_mean_token_accuracy": 0.849291454220927, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.6728, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1660 + }, + { + "entropy": 0.3095553796738386, + "epoch": 4.179327521793275, + "grad_norm": 0.7059140801429749, + "learning_rate": 0.0001635652718453007, + "loss": 0.23651680946350098, + "mean_token_accuracy": 0.9208931416273117, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.3910588648949945, + "eval_loss": 0.6104469299316406, + "eval_mean_token_accuracy": 0.8486883893262508, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7612, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.982, + "step": 1680 + }, + { + "entropy": 0.3001101028174162, + "epoch": 4.229140722291407, + "grad_norm": 0.6787802577018738, + "learning_rate": 0.00016179886210406728, + "loss": 0.23130471706390382, + "mean_token_accuracy": 0.9233332790434361, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3794369170832079, + "eval_loss": 0.6182110905647278, + "eval_mean_token_accuracy": 0.8495433777570724, + "eval_num_tokens": 3967474.0, + "eval_runtime": 85.94, + "eval_samples_per_second": 16.0, + "eval_steps_per_second": 2.001, + "step": 1700 + }, + { + "entropy": 0.3031421799212694, + "epoch": 4.2789539227895395, + "grad_norm": 0.9732038378715515, + "learning_rate": 0.0001600177774318036, + "loss": 0.2359529733657837, + "mean_token_accuracy": 0.9217648565769195, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3923123094231583, + "eval_loss": 0.6057384610176086, + "eval_mean_token_accuracy": 0.8508818288182103, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7647, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.29365369994193313, + "epoch": 4.328767123287671, + "grad_norm": 0.7681498527526855, + "learning_rate": 0.0001582225549793541, + "loss": 0.2269371747970581, + "mean_token_accuracy": 0.9245341829955578, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.4011661055129628, + "eval_loss": 0.6144486665725708, + "eval_mean_token_accuracy": 0.8480324357054955, + "eval_num_tokens": 4062594.0, + "eval_runtime": 87.1306, + "eval_samples_per_second": 15.781, + "eval_steps_per_second": 1.974, + "step": 1740 + }, + { + "entropy": 0.29396994728595016, + "epoch": 4.378580323785803, + "grad_norm": 1.0001007318496704, + "learning_rate": 0.0001564137361613248, + "loss": 0.22777395248413085, + "mean_token_accuracy": 0.9262309700250626, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38518730195802314, + "eval_loss": 0.6202630400657654, + "eval_mean_token_accuracy": 0.8493869807137999, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6616, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.3096018506214023, + "epoch": 4.428393524283935, + "grad_norm": 1.0448365211486816, + "learning_rate": 0.00015459186649280024, + "loss": 0.23696351051330566, + "mean_token_accuracy": 0.9217322513461113, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.3946371126140273, + "eval_loss": 0.6079026460647583, + "eval_mean_token_accuracy": 0.8492515852978063, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6582, + "eval_samples_per_second": 15.867, + "eval_steps_per_second": 1.985, + "step": 1780 + }, + { + "entropy": 0.32619857545942066, + "epoch": 4.478206724782067, + "grad_norm": 0.7210651636123657, + "learning_rate": 0.00015275749542482337, + "loss": 0.24651215076446534, + "mean_token_accuracy": 0.9177676141262054, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.3947690814560236, + "eval_loss": 0.6065912246704102, + "eval_mean_token_accuracy": 0.8502957744653835, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.5959, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.986, + "step": 1800 + }, + { + "entropy": 0.3193941755220294, + "epoch": 4.5280199252802, + "grad_norm": 0.8281906843185425, + "learning_rate": 0.0001509111761786888, + "loss": 0.23936262130737304, + "mean_token_accuracy": 0.9201708927750587, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38704028864239537, + "eval_loss": 0.6006569266319275, + "eval_mean_token_accuracy": 0.8502406720505205, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.8059, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1820 + }, + { + "entropy": 0.3164879363030195, + "epoch": 4.577833125778331, + "grad_norm": 0.7892968654632568, + "learning_rate": 0.00014905346557909867, + "loss": 0.24541733264923096, + "mean_token_accuracy": 0.9175932116806507, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.38861122120951497, + "eval_loss": 0.6115967631340027, + "eval_mean_token_accuracy": 0.849471275196519, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.2946, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1840 + }, + { + "entropy": 0.3051785985007882, + "epoch": 4.627646326276463, + "grad_norm": 0.8109654188156128, + "learning_rate": 0.0001471849238862319, + "loss": 0.23433220386505127, + "mean_token_accuracy": 0.9206570319831371, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.37162452295076015, + "eval_loss": 0.6184061765670776, + "eval_mean_token_accuracy": 0.8501173268223918, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.6865, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1860 + }, + { + "entropy": 0.3168198253959417, + "epoch": 4.677459526774595, + "grad_norm": 0.9512342214584351, + "learning_rate": 0.0001453061146267775, + "loss": 0.23832404613494873, + "mean_token_accuracy": 0.9197044663131237, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3845940856912801, + "eval_loss": 0.606762707233429, + "eval_mean_token_accuracy": 0.8504838194957999, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.5175, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 1880 + }, + { + "entropy": 0.30791807882487776, + "epoch": 4.7272727272727275, + "grad_norm": 0.8123113512992859, + "learning_rate": 0.00014341760442398248, + "loss": 0.2395785331726074, + "mean_token_accuracy": 0.918928150832653, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.39762327222283494, + "eval_loss": 0.5994202494621277, + "eval_mean_token_accuracy": 0.8509274201337681, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.2873, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.993, + "step": 1900 + }, + { + "entropy": 0.3021434534341097, + "epoch": 4.777085927770859, + "grad_norm": 0.731787383556366, + "learning_rate": 0.000141519962826766, + "loss": 0.23494718074798585, + "mean_token_accuracy": 0.9201403826475143, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.3827026732439219, + "eval_loss": 0.5995895862579346, + "eval_mean_token_accuracy": 0.851468373523202, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.3006, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 1920 + }, + { + "entropy": 0.31626159623265265, + "epoch": 4.826899128268991, + "grad_norm": 0.8848487138748169, + "learning_rate": 0.00013961376213795132, + "loss": 0.2439030647277832, + "mean_token_accuracy": 0.9196575872600079, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.388698436839636, + "eval_loss": 0.6000174283981323, + "eval_mean_token_accuracy": 0.8518068187458571, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.8979, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.979, + "step": 1940 + }, + { + "entropy": 0.30520407035946845, + "epoch": 4.876712328767123, + "grad_norm": 0.8532460927963257, + "learning_rate": 0.00013769957724166695, + "loss": 0.23458616733551024, + "mean_token_accuracy": 0.9221912942826748, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.38777847102908203, + "eval_loss": 0.6004981398582458, + "eval_mean_token_accuracy": 0.8516481768253238, + "eval_num_tokens": 4578167.0, + "eval_runtime": 87.0777, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.975, + "step": 1960 + }, + { + "entropy": 0.3226448342204094, + "epoch": 4.926525529265255, + "grad_norm": 0.6945561766624451, + "learning_rate": 0.0001357779854299694, + "loss": 0.24048397541046143, + "mean_token_accuracy": 0.9195300146937371, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.38581624263247777, + "eval_loss": 0.6029234528541565, + "eval_mean_token_accuracy": 0.8514213260523108, + "eval_num_tokens": 4622316.0, + "eval_runtime": 85.8729, + "eval_samples_per_second": 16.012, + "eval_steps_per_second": 2.003, + "step": 1980 + }, + { + "entropy": 0.3051655298098922, + "epoch": 4.976338729763388, + "grad_norm": 0.7976452708244324, + "learning_rate": 0.00013384956622874001, + "loss": 0.23584742546081544, + "mean_token_accuracy": 0.9216851457953453, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.37913159246361533, + "eval_loss": 0.6057604551315308, + "eval_mean_token_accuracy": 0.8525801203971686, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.1145, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 2000 + }, + { + "entropy": 0.27438195240803254, + "epoch": 5.024906600249066, + "grad_norm": 0.6729586124420166, + "learning_rate": 0.0001319149012229075, + "loss": 0.19775952100753785, + "mean_token_accuracy": 0.9339428559327737, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.3448961910813354, + "eval_loss": 0.6750120520591736, + "eval_mean_token_accuracy": 0.8487970232963562, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.1169, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 2020 + }, + { + "entropy": 0.21423916313797237, + "epoch": 5.074719800747198, + "grad_norm": 0.6934391856193542, + "learning_rate": 0.00012997457388105022, + "loss": 0.1439570426940918, + "mean_token_accuracy": 0.9528236843645572, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.3570949243771475, + "eval_loss": 0.6465504169464111, + "eval_mean_token_accuracy": 0.8490785547467166, + "eval_num_tokens": 4763269.0, + "eval_runtime": 85.9574, + "eval_samples_per_second": 15.996, + "eval_steps_per_second": 2.001, + "step": 2040 + }, + { + "entropy": 0.20838565267622472, + "epoch": 5.12453300124533, + "grad_norm": 0.7286986112594604, + "learning_rate": 0.00012802916937942972, + "loss": 0.14467307329177856, + "mean_token_accuracy": 0.950994835793972, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.3452463157821533, + "eval_loss": 0.6705958843231201, + "eval_mean_token_accuracy": 0.8490352796953778, + "eval_num_tokens": 4809047.0, + "eval_runtime": 86.228, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 2060 + }, + { + "entropy": 0.20453082229942082, + "epoch": 5.174346201743462, + "grad_norm": 0.7515555620193481, + "learning_rate": 0.00012607927442550974, + "loss": 0.13732000589370727, + "mean_token_accuracy": 0.9537357829511166, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.32431264914745506, + "eval_loss": 0.6743043065071106, + "eval_mean_token_accuracy": 0.8504878629085629, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.5948, + "eval_samples_per_second": 15.879, + "eval_steps_per_second": 1.986, + "step": 2080 + }, + { + "entropy": 0.21812320686876774, + "epoch": 5.224159402241594, + "grad_norm": 0.9093465209007263, + "learning_rate": 0.0001241254770810132, + "loss": 0.14311420917510986, + "mean_token_accuracy": 0.9514068141579628, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.33086285835435225, + "eval_loss": 0.6676449179649353, + "eval_mean_token_accuracy": 0.8505287662495015, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 2100 + }, + { + "entropy": 0.2180163251236081, + "epoch": 5.273972602739726, + "grad_norm": 0.6703007221221924, + "learning_rate": 0.00012216836658457075, + "loss": 0.14803968667984008, + "mean_token_accuracy": 0.9521303348243236, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.33162341708707255, + "eval_loss": 0.6658875942230225, + "eval_mean_token_accuracy": 0.8500757605530495, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.6296, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 2120 + }, + { + "entropy": 0.22511130161583423, + "epoch": 5.323785803237858, + "grad_norm": 0.8078880906105042, + "learning_rate": 0.00012020853317401455, + "loss": 0.15228408575057983, + "mean_token_accuracy": 0.947144789993763, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3354601170434508, + "eval_loss": 0.6677829623222351, + "eval_mean_token_accuracy": 0.8482600024273229, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.4689, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.989, + "step": 2140 + }, + { + "entropy": 0.2244176059961319, + "epoch": 5.37359900373599, + "grad_norm": 0.9636075496673584, + "learning_rate": 0.00011824656790837037, + "loss": 0.15260883569717407, + "mean_token_accuracy": 0.9471467643976211, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.3381616926297199, + "eval_loss": 0.6694412231445312, + "eval_mean_token_accuracy": 0.8482369603805764, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.4147, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 2160 + }, + { + "entropy": 0.22982364390045404, + "epoch": 5.423412204234122, + "grad_norm": 0.775401771068573, + "learning_rate": 0.00011628306248960262, + "loss": 0.15140302181243898, + "mean_token_accuracy": 0.9492553934454918, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.3305150235808173, + "eval_loss": 0.6717822551727295, + "eval_mean_token_accuracy": 0.8489849723355715, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.4728, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.989, + "step": 2180 + }, + { + "entropy": 0.21448935717344284, + "epoch": 5.473225404732254, + "grad_norm": 0.6575281023979187, + "learning_rate": 0.00011431860908416465, + "loss": 0.1452319622039795, + "mean_token_accuracy": 0.9505287684500218, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3488145174328671, + "eval_loss": 0.6612305641174316, + "eval_mean_token_accuracy": 0.8492907808963642, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6927, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 2200 + }, + { + "entropy": 0.23091202937066554, + "epoch": 5.523038605230386, + "grad_norm": 0.8909686207771301, + "learning_rate": 0.00011235380014440985, + "loss": 0.15150139331817628, + "mean_token_accuracy": 0.9497875183820724, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.3268539015810157, + "eval_loss": 0.6667542457580566, + "eval_mean_token_accuracy": 0.8499062903398691, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.4644, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 2220 + }, + { + "entropy": 0.2227974807843566, + "epoch": 5.572851805728518, + "grad_norm": 0.6180275082588196, + "learning_rate": 0.0001103892282299158, + "loss": 0.1491069197654724, + "mean_token_accuracy": 0.9488144010305405, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3346347655494546, + "eval_loss": 0.6665948629379272, + "eval_mean_token_accuracy": 0.8499961893918903, + "eval_num_tokens": 5226864.0, + "eval_runtime": 87.0548, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.976, + "step": 2240 + }, + { + "entropy": 0.21368421968072654, + "epoch": 5.62266500622665, + "grad_norm": 0.6004369258880615, + "learning_rate": 0.00010842548582877651, + "loss": 0.14485255479812623, + "mean_token_accuracy": 0.9502056457102299, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.32753298804163933, + "eval_loss": 0.6680151224136353, + "eval_mean_token_accuracy": 0.8515451086121936, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.8524, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.98, + "step": 2260 + }, + { + "entropy": 0.2103635374456644, + "epoch": 5.672478206724782, + "grad_norm": 0.699174702167511, + "learning_rate": 0.00010646316517891613, + "loss": 0.14297772645950318, + "mean_token_accuracy": 0.9512537539005279, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.32966585959806, + "eval_loss": 0.675578773021698, + "eval_mean_token_accuracy": 0.8509623023659684, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.4518, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.99, + "step": 2280 + }, + { + "entropy": 0.22516900151968003, + "epoch": 5.722291407222914, + "grad_norm": 0.6637354493141174, + "learning_rate": 0.00010450285808947797, + "loss": 0.15202572345733642, + "mean_token_accuracy": 0.9482452072203159, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3369456917740578, + "eval_loss": 0.6697061061859131, + "eval_mean_token_accuracy": 0.848603522361711, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.6371, + "eval_samples_per_second": 15.871, + "eval_steps_per_second": 1.985, + "step": 2300 + }, + { + "entropy": 0.21841065725311637, + "epoch": 5.772104607721046, + "grad_norm": 0.7940268516540527, + "learning_rate": 0.00010254515576234297, + "loss": 0.14710167646408082, + "mean_token_accuracy": 0.9493498183786869, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3237486180177955, + "eval_loss": 0.6779657602310181, + "eval_mean_token_accuracy": 0.8500715313955794, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.1826, + "eval_samples_per_second": 15.954, + "eval_steps_per_second": 1.996, + "step": 2320 + }, + { + "entropy": 0.22146204356104135, + "epoch": 5.821917808219178, + "grad_norm": 0.9234833121299744, + "learning_rate": 0.00010059064861383132, + "loss": 0.14720046520233154, + "mean_token_accuracy": 0.9493872679769992, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.32365207564692167, + "eval_loss": 0.6704005002975464, + "eval_mean_token_accuracy": 0.8507985760306203, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.5494, + "eval_samples_per_second": 15.887, + "eval_steps_per_second": 1.987, + "step": 2340 + }, + { + "entropy": 0.20934011954814197, + "epoch": 5.87173100871731, + "grad_norm": 0.5547503232955933, + "learning_rate": 9.863992609664084e-05, + "loss": 0.1464867353439331, + "mean_token_accuracy": 0.9503875687718392, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.3330401429083458, + "eval_loss": 0.6659091114997864, + "eval_mean_token_accuracy": 0.8504848906467127, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.5855, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 2360 + }, + { + "entropy": 0.21678635366261007, + "epoch": 5.921544209215442, + "grad_norm": 0.570612907409668, + "learning_rate": 9.669357652207635e-05, + "loss": 0.14821385145187377, + "mean_token_accuracy": 0.9503940217196941, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3322022325077722, + "eval_loss": 0.6722489595413208, + "eval_mean_token_accuracy": 0.8489979422369669, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.2986, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 2380 + }, + { + "entropy": 0.20932920072227718, + "epoch": 5.971357409713574, + "grad_norm": 0.7879557609558105, + "learning_rate": 9.475218688262262e-05, + "loss": 0.14675841331481934, + "mean_token_accuracy": 0.9507176131010056, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.3199348642902319, + "eval_loss": 0.6698136329650879, + "eval_mean_token_accuracy": 0.8514142130003419, + "eval_num_tokens": 5605400.0, + "eval_runtime": 85.8995, + "eval_samples_per_second": 16.007, + "eval_steps_per_second": 2.002, + "step": 2400 + }, + { + "entropy": 0.21032143919131693, + "epoch": 6.019925280199253, + "grad_norm": 0.5823076367378235, + "learning_rate": 9.281634267491569e-05, + "loss": 0.13322267532348633, + "mean_token_accuracy": 0.9550939072401096, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.30206270117399303, + "eval_loss": 0.7093168497085571, + "eval_mean_token_accuracy": 0.8500627639681794, + "eval_num_tokens": 5648968.0, + "eval_runtime": 85.8128, + "eval_samples_per_second": 16.023, + "eval_steps_per_second": 2.004, + "step": 2420 + }, + { + "entropy": 0.1534628233872354, + "epoch": 6.069738480697385, + "grad_norm": 0.710133969783783, + "learning_rate": 9.088662772316508e-05, + "loss": 0.09078952670097351, + "mean_token_accuracy": 0.9678447999060154, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.28208133101809857, + "eval_loss": 0.7636417150497437, + "eval_mean_token_accuracy": 0.8494061477655588, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9724, + "eval_samples_per_second": 15.994, + "eval_steps_per_second": 2.001, + "step": 2440 + }, + { + "entropy": 0.16151462448760867, + "epoch": 6.119551681195516, + "grad_norm": 0.5793812274932861, + "learning_rate": 8.896362400308028e-05, + "loss": 0.09545697569847107, + "mean_token_accuracy": 0.9671573750674725, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.2833245605403601, + "eval_loss": 0.7402405738830566, + "eval_mean_token_accuracy": 0.8503523728875226, + "eval_num_tokens": 5745090.0, + "eval_runtime": 85.5461, + "eval_samples_per_second": 16.073, + "eval_steps_per_second": 2.011, + "step": 2460 + }, + { + "entropy": 0.15203177919611335, + "epoch": 6.169364881693649, + "grad_norm": 0.4251123368740082, + "learning_rate": 8.704791146635483e-05, + "loss": 0.09420782327651978, + "mean_token_accuracy": 0.9677386932075024, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.28572545962971313, + "eval_loss": 0.735416829586029, + "eval_mean_token_accuracy": 0.8487084663884584, + "eval_num_tokens": 5790333.0, + "eval_runtime": 85.4801, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.012, + "step": 2480 + }, + { + "entropy": 0.15587336672469973, + "epoch": 6.219178082191781, + "grad_norm": 0.4357028007507324, + "learning_rate": 8.514006786576085e-05, + "loss": 0.09429320096969604, + "mean_token_accuracy": 0.9682952925562859, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.2859006894882335, + "eval_loss": 0.7347224950790405, + "eval_mean_token_accuracy": 0.8501905518215757, + "eval_num_tokens": 5837321.0, + "eval_runtime": 85.7578, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.006, + "step": 2500 + }, + { + "entropy": 0.15765639198943973, + "epoch": 6.268991282689913, + "grad_norm": 0.47331130504608154, + "learning_rate": 8.324066858090663e-05, + "loss": 0.09571113586425781, + "mean_token_accuracy": 0.9683481335639954, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.29231513846059176, + "eval_loss": 0.7392512559890747, + "eval_mean_token_accuracy": 0.8486633983462356, + "eval_num_tokens": 5884398.0, + "eval_runtime": 85.7846, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.005, + "step": 2520 + }, + { + "entropy": 0.16176860257983208, + "epoch": 6.318804483188045, + "grad_norm": 0.6142018437385559, + "learning_rate": 8.135028644470992e-05, + "loss": 0.09486144185066223, + "mean_token_accuracy": 0.9682316601276397, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.2851274753379267, + "eval_loss": 0.7520816922187805, + "eval_mean_token_accuracy": 0.8501113649717597, + "eval_num_tokens": 5929876.0, + "eval_runtime": 85.9425, + "eval_samples_per_second": 15.999, + "eval_steps_per_second": 2.001, + "step": 2540 + }, + { + "entropy": 0.15404034564271568, + "epoch": 6.3686176836861765, + "grad_norm": 0.6051287651062012, + "learning_rate": 7.946949157063964e-05, + "loss": 0.09280472993850708, + "mean_token_accuracy": 0.9684635892510414, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28802703563557114, + "eval_loss": 0.7439162135124207, + "eval_mean_token_accuracy": 0.8499851770872293, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.0703, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.998, + "step": 2560 + }, + { + "entropy": 0.15343588953837753, + "epoch": 6.418430884184309, + "grad_norm": 0.4823743402957916, + "learning_rate": 7.759885118077701e-05, + "loss": 0.09000591039657593, + "mean_token_accuracy": 0.9699928767979145, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2795634938533916, + "eval_loss": 0.7647850513458252, + "eval_mean_token_accuracy": 0.8503464397995971, + "eval_num_tokens": 6025380.0, + "eval_runtime": 85.8886, + "eval_samples_per_second": 16.009, + "eval_steps_per_second": 2.003, + "step": 2580 + }, + { + "entropy": 0.15740026142448188, + "epoch": 6.468244084682441, + "grad_norm": 0.5082696676254272, + "learning_rate": 7.57389294347494e-05, + "loss": 0.09191849827766418, + "mean_token_accuracy": 0.9692809768021107, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2913342311458532, + "eval_loss": 0.7518694996833801, + "eval_mean_token_accuracy": 0.8483168302580367, + "eval_num_tokens": 6073349.0, + "eval_runtime": 85.5761, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.01, + "step": 2600 + }, + { + "entropy": 0.15922069251537324, + "epoch": 6.518057285180573, + "grad_norm": 0.3995199501514435, + "learning_rate": 7.389028725958736e-05, + "loss": 0.09584367871284485, + "mean_token_accuracy": 0.9685114495456218, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.2863075934177221, + "eval_loss": 0.7539381384849548, + "eval_mean_token_accuracy": 0.8507507083027862, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.112, + "eval_samples_per_second": 15.968, + "eval_steps_per_second": 1.997, + "step": 2620 + }, + { + "entropy": 0.16197575423866512, + "epoch": 6.567870485678705, + "grad_norm": 0.534295380115509, + "learning_rate": 7.205348218055678e-05, + "loss": 0.0961170256137848, + "mean_token_accuracy": 0.9674530044198036, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.29021967315050057, + "eval_loss": 0.751198947429657, + "eval_mean_token_accuracy": 0.8509796344956686, + "eval_num_tokens": 6165523.0, + "eval_runtime": 85.7958, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.005, + "step": 2640 + }, + { + "entropy": 0.15261746793985367, + "epoch": 6.617683686176837, + "grad_norm": 0.5391237139701843, + "learning_rate": 7.022906815301673e-05, + "loss": 0.0926026999950409, + "mean_token_accuracy": 0.9695659473538398, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.29128045216202736, + "eval_loss": 0.7450292110443115, + "eval_mean_token_accuracy": 0.8498771443616512, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.3963, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 2660 + }, + { + "entropy": 0.16164180357009172, + "epoch": 6.667496886674969, + "grad_norm": 0.5767946243286133, + "learning_rate": 6.841759539535419e-05, + "loss": 0.09291981458663941, + "mean_token_accuracy": 0.9687136687338352, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2897637223088464, + "eval_loss": 0.7503410577774048, + "eval_mean_token_accuracy": 0.8503315164599308, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.0653, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.998, + "step": 2680 + }, + { + "entropy": 0.17062523355707526, + "epoch": 6.717310087173101, + "grad_norm": 0.4974168539047241, + "learning_rate": 6.661961022304563e-05, + "loss": 0.09713236689567566, + "mean_token_accuracy": 0.9661971725523472, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2765843396963075, + "eval_loss": 0.7604002356529236, + "eval_mean_token_accuracy": 0.8521115277395692, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.1676, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 2700 + }, + { + "entropy": 0.17544092936441302, + "epoch": 6.767123287671232, + "grad_norm": 0.5523537993431091, + "learning_rate": 6.483565488389582e-05, + "loss": 0.09709116220474243, + "mean_token_accuracy": 0.9650957375764847, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.27939334659035814, + "eval_loss": 0.7534670829772949, + "eval_mean_token_accuracy": 0.851230604010959, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.2913, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 2720 + }, + { + "entropy": 0.15991022661328316, + "epoch": 6.816936488169365, + "grad_norm": 0.478551983833313, + "learning_rate": 6.306626739450311e-05, + "loss": 0.09564646482467651, + "mean_token_accuracy": 0.9679084822535515, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.27878295491601146, + "eval_loss": 0.7519959211349487, + "eval_mean_token_accuracy": 0.8510654949864676, + "eval_num_tokens": 6397720.0, + "eval_runtime": 85.9109, + "eval_samples_per_second": 16.005, + "eval_steps_per_second": 2.002, + "step": 2740 + }, + { + "entropy": 0.16824879590421915, + "epoch": 6.866749688667497, + "grad_norm": 0.6681098937988281, + "learning_rate": 6.131198137800108e-05, + "loss": 0.0962279736995697, + "mean_token_accuracy": 0.966830012947321, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.2834690434121808, + "eval_loss": 0.751922070980072, + "eval_mean_token_accuracy": 0.8521237577809844, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.3618, + "eval_samples_per_second": 15.921, + "eval_steps_per_second": 1.992, + "step": 2760 + }, + { + "entropy": 0.1518704930320382, + "epoch": 6.916562889165629, + "grad_norm": 0.5201290249824524, + "learning_rate": 5.957332590312513e-05, + "loss": 0.09010660648345947, + "mean_token_accuracy": 0.9693463340401649, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.28485129617674404, + "eval_loss": 0.7452457547187805, + "eval_mean_token_accuracy": 0.8512036796919135, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.4524, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.99, + "step": 2780 + }, + { + "entropy": 0.15512610590085388, + "epoch": 6.966376089663761, + "grad_norm": 0.42802050709724426, + "learning_rate": 5.785082532465233e-05, + "loss": 0.09320432543754578, + "mean_token_accuracy": 0.9686134628951549, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.27554594526110693, + "eval_loss": 0.7644653916358948, + "eval_mean_token_accuracy": 0.8513738523389018, + "eval_num_tokens": 6540175.0, + "eval_runtime": 85.7609, + "eval_samples_per_second": 16.033, + "eval_steps_per_second": 2.006, + "step": 2800 + }, + { + "entropy": 0.17524497526196334, + "epoch": 7.01494396014944, + "grad_norm": 0.3330269157886505, + "learning_rate": 5.6144999125263545e-05, + "loss": 0.0895616888999939, + "mean_token_accuracy": 0.9682766932707566, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.2735865569218647, + "eval_loss": 0.768479585647583, + "eval_mean_token_accuracy": 0.8503459383581959, + "eval_num_tokens": 6583767.0, + "eval_runtime": 85.7162, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.007, + "step": 2820 + }, + { + "entropy": 0.1403565663844347, + "epoch": 7.064757160647572, + "grad_norm": 0.35613498091697693, + "learning_rate": 5.4456361758874235e-05, + "loss": 0.07551313638687134, + "mean_token_accuracy": 0.9739301167428493, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.25941789089593775, + "eval_loss": 0.8209511637687683, + "eval_mean_token_accuracy": 0.8505055855873019, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.0943, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 2840 + }, + { + "entropy": 0.13500106502324344, + "epoch": 7.114570361145703, + "grad_norm": 0.34418627619743347, + "learning_rate": 5.2785422495482234e-05, + "loss": 0.07293946146965027, + "mean_token_accuracy": 0.9747208289802074, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.26482899772912954, + "eval_loss": 0.798904538154602, + "eval_mean_token_accuracy": 0.8511530233677044, + "eval_num_tokens": 6672946.0, + "eval_runtime": 85.7915, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.005, + "step": 2860 + }, + { + "entropy": 0.13127502552233636, + "epoch": 7.164383561643835, + "grad_norm": 0.4638441503047943, + "learning_rate": 5.113268526757892e-05, + "loss": 0.07121461629867554, + "mean_token_accuracy": 0.9756786689162255, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2645381211714689, + "eval_loss": 0.809101939201355, + "eval_mean_token_accuracy": 0.8514727898115335, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.84, + "eval_samples_per_second": 16.018, + "eval_steps_per_second": 2.004, + "step": 2880 + }, + { + "entropy": 0.1331390908919275, + "epoch": 7.214196762141968, + "grad_norm": 0.40206775069236755, + "learning_rate": 4.949864851817007e-05, + "loss": 0.07188264131546021, + "mean_token_accuracy": 0.9755406074225903, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.26244733283339544, + "eval_loss": 0.8143188953399658, + "eval_mean_token_accuracy": 0.8514358189909957, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.8546, + "eval_samples_per_second": 16.015, + "eval_steps_per_second": 2.003, + "step": 2900 + }, + { + "entropy": 0.13647331558167936, + "epoch": 7.2640099626401, + "grad_norm": 0.26405787467956543, + "learning_rate": 4.788380505045224e-05, + "loss": 0.07412450313568116, + "mean_token_accuracy": 0.9744274213910102, + "num_tokens": 6809678.0, + "step": 2920 + }, + { + "epoch": 7.2640099626401, + "eval_entropy": 0.2626111418182074, + "eval_loss": 0.8111525177955627, + "eval_mean_token_accuracy": 0.8512121695418691, + "eval_num_tokens": 6809678.0, + "eval_runtime": 85.9626, + "eval_samples_per_second": 15.995, + "eval_steps_per_second": 2.001, + "step": 2920 + }, + { + "entropy": 0.12644002586603165, + "epoch": 7.313823163138232, + "grad_norm": 0.27514681220054626, + "learning_rate": 4.6288641879189884e-05, + "loss": 0.06807711124420165, + "mean_token_accuracy": 0.9760703906416893, + "num_tokens": 6860750.0, + "step": 2940 + }, + { + "epoch": 7.313823163138232, + "eval_entropy": 0.26096762734097106, + "eval_loss": 0.8184595108032227, + "eval_mean_token_accuracy": 0.8501476153384807, + "eval_num_tokens": 6860750.0, + "eval_runtime": 85.9521, + "eval_samples_per_second": 15.997, + "eval_steps_per_second": 2.001, + "step": 2940 + }, + { + "entropy": 0.13920630998909472, + "epoch": 7.363636363636363, + "grad_norm": 0.23584705591201782, + "learning_rate": 4.4713640083838604e-05, + "loss": 0.07301607131958007, + "mean_token_accuracy": 0.9745715200901032, + "num_tokens": 6907092.0, + "step": 2960 + }, + { + "epoch": 7.363636363636363, + "eval_entropy": 0.2612536767021168, + "eval_loss": 0.8116245269775391, + "eval_mean_token_accuracy": 0.8510967350976412, + "eval_num_tokens": 6907092.0, + "eval_runtime": 85.6373, + "eval_samples_per_second": 16.056, + "eval_steps_per_second": 2.008, + "step": 2960 + }, + { + "entropy": 0.1349492883309722, + "epoch": 7.4134495641344955, + "grad_norm": 0.24552719295024872, + "learning_rate": 4.315927466345791e-05, + "loss": 0.07397544980049134, + "mean_token_accuracy": 0.9745095103979111, + "num_tokens": 6952700.0, + "step": 2980 + }, + { + "epoch": 7.4134495641344955, + "eval_entropy": 0.25796533306670744, + "eval_loss": 0.8266491293907166, + "eval_mean_token_accuracy": 0.8511653857868772, + "eval_num_tokens": 6952700.0, + "eval_runtime": 85.7462, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.006, + "step": 2980 + }, + { + "entropy": 0.14479175000451505, + "epoch": 7.463262764632628, + "grad_norm": 0.2846072018146515, + "learning_rate": 4.162601439345814e-05, + "loss": 0.07544798254966736, + "mean_token_accuracy": 0.9727819666266442, + "num_tokens": 6996430.0, + "step": 3000 + }, + { + "epoch": 7.463262764632628, + "eval_entropy": 0.2584348309698493, + "eval_loss": 0.8253348469734192, + "eval_mean_token_accuracy": 0.8511569815319638, + "eval_num_tokens": 6996430.0, + "eval_runtime": 86.2984, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 3000 + }, + { + "entropy": 0.14114196319133043, + "epoch": 7.51307596513076, + "grad_norm": 0.407966285943985, + "learning_rate": 4.011432168422419e-05, + "loss": 0.0736398994922638, + "mean_token_accuracy": 0.9741654269397259, + "num_tokens": 7042038.0, + "step": 3020 + }, + { + "epoch": 7.51307596513076, + "eval_entropy": 0.25232676260693127, + "eval_loss": 0.8296052813529968, + "eval_mean_token_accuracy": 0.8523298349491385, + "eval_num_tokens": 7042038.0, + "eval_runtime": 85.8445, + "eval_samples_per_second": 16.017, + "eval_steps_per_second": 2.004, + "step": 3020 + }, + { + "entropy": 0.1353456223383546, + "epoch": 7.562889165628892, + "grad_norm": 0.2712634801864624, + "learning_rate": 3.8624652441658684e-05, + "loss": 0.07362412214279175, + "mean_token_accuracy": 0.9747945807874203, + "num_tokens": 7089390.0, + "step": 3040 + }, + { + "epoch": 7.562889165628892, + "eval_entropy": 0.2579477243991785, + "eval_loss": 0.8274564743041992, + "eval_mean_token_accuracy": 0.8517705212498821, + "eval_num_tokens": 7089390.0, + "eval_runtime": 85.8222, + "eval_samples_per_second": 16.022, + "eval_steps_per_second": 2.004, + "step": 3040 + }, + { + "entropy": 0.1296080862637609, + "epoch": 7.6127023661270234, + "grad_norm": 0.2371893972158432, + "learning_rate": 3.715745592968707e-05, + "loss": 0.06971035599708557, + "mean_token_accuracy": 0.9759043246507645, + "num_tokens": 7138002.0, + "step": 3060 + }, + { + "epoch": 7.6127023661270234, + "eval_entropy": 0.25391967083479083, + "eval_loss": 0.8197130560874939, + "eval_mean_token_accuracy": 0.8522267875283264, + "eval_num_tokens": 7138002.0, + "eval_runtime": 85.8796, + "eval_samples_per_second": 16.011, + "eval_steps_per_second": 2.003, + "step": 3060 + }, + { + "entropy": 0.1311203008517623, + "epoch": 7.662515566625156, + "grad_norm": 0.22499267756938934, + "learning_rate": 3.5713174634765967e-05, + "loss": 0.07176244258880615, + "mean_token_accuracy": 0.9754939571022987, + "num_tokens": 7185520.0, + "step": 3080 + }, + { + "epoch": 7.662515566625156, + "eval_entropy": 0.2526215241225653, + "eval_loss": 0.8265154361724854, + "eval_mean_token_accuracy": 0.8519952584837758, + "eval_num_tokens": 7185520.0, + "eval_runtime": 85.8746, + "eval_samples_per_second": 16.012, + "eval_steps_per_second": 2.003, + "step": 3080 + }, + { + "entropy": 0.13420484317466616, + "epoch": 7.712328767123288, + "grad_norm": 0.2398064285516739, + "learning_rate": 3.4292244132434866e-05, + "loss": 0.07559212446212768, + "mean_token_accuracy": 0.9743142127990723, + "num_tokens": 7232170.0, + "step": 3100 + }, + { + "epoch": 7.712328767123288, + "eval_entropy": 0.2484562756537005, + "eval_loss": 0.8312150239944458, + "eval_mean_token_accuracy": 0.8528405119513356, + "eval_num_tokens": 7232170.0, + "eval_runtime": 85.7896, + "eval_samples_per_second": 16.028, + "eval_steps_per_second": 2.005, + "step": 3100 + }, + { + "entropy": 0.11965563679113984, + "epoch": 7.76214196762142, + "grad_norm": 0.3408384919166565, + "learning_rate": 3.2895092955952746e-05, + "loss": 0.0661750853061676, + "mean_token_accuracy": 0.9776600524783134, + "num_tokens": 7282846.0, + "step": 3120 + }, + { + "epoch": 7.76214196762142, + "eval_entropy": 0.2522421533804993, + "eval_loss": 0.8327009677886963, + "eval_mean_token_accuracy": 0.8524222023958383, + "eval_num_tokens": 7282846.0, + "eval_runtime": 86.1769, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 1.996, + "step": 3120 + }, + { + "entropy": 0.13388084415346385, + "epoch": 7.811955168119551, + "grad_norm": 0.35418516397476196, + "learning_rate": 3.152214246705829e-05, + "loss": 0.07149899601936341, + "mean_token_accuracy": 0.9747635535895824, + "num_tokens": 7331518.0, + "step": 3140 + }, + { + "epoch": 7.811955168119551, + "eval_entropy": 0.25038352296795957, + "eval_loss": 0.836457371711731, + "eval_mean_token_accuracy": 0.8526130665180295, + "eval_num_tokens": 7331518.0, + "eval_runtime": 85.6099, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.009, + "step": 3140 + }, + { + "entropy": 0.13530643959529698, + "epoch": 7.861768368617684, + "grad_norm": 0.38060539960861206, + "learning_rate": 3.017380672889291e-05, + "loss": 0.07116585969924927, + "mean_token_accuracy": 0.973284512758255, + "num_tokens": 7379056.0, + "step": 3160 + }, + { + "epoch": 7.861768368617684, + "eval_entropy": 0.255092611319797, + "eval_loss": 0.8314701914787292, + "eval_mean_token_accuracy": 0.8520913099826768, + "eval_num_tokens": 7379056.0, + "eval_runtime": 85.877, + "eval_samples_per_second": 16.011, + "eval_steps_per_second": 2.003, + "step": 3160 + }, + { + "entropy": 0.13383390177041293, + "epoch": 7.911581569115816, + "grad_norm": 0.3827536106109619, + "learning_rate": 2.8850492381124808e-05, + "loss": 0.07305437326431274, + "mean_token_accuracy": 0.9750778004527092, + "num_tokens": 7424770.0, + "step": 3180 + }, + { + "epoch": 7.911581569115816, + "eval_entropy": 0.25416371157003004, + "eval_loss": 0.8206402063369751, + "eval_mean_token_accuracy": 0.852779901651449, + "eval_num_tokens": 7424770.0, + "eval_runtime": 86.1015, + "eval_samples_per_second": 15.97, + "eval_steps_per_second": 1.998, + "step": 3180 + }, + { + "entropy": 0.1395680439658463, + "epoch": 7.961394769613948, + "grad_norm": 0.3809775412082672, + "learning_rate": 2.7552598517312256e-05, + "loss": 0.07236042022705078, + "mean_token_accuracy": 0.9731538116931915, + "num_tokens": 7470804.0, + "step": 3200 + }, + { + "epoch": 7.961394769613948, + "eval_entropy": 0.25528111975899964, + "eval_loss": 0.8230037093162537, + "eval_mean_token_accuracy": 0.8526452603035195, + "eval_num_tokens": 7470804.0, + "eval_runtime": 85.7895, + "eval_samples_per_second": 16.028, + "eval_steps_per_second": 2.005, + "step": 3200 + }, + { + "entropy": 0.12193699864049752, + "epoch": 8.009962640099626, + "grad_norm": 0.11854425817728043, + "learning_rate": 2.6280516564542205e-05, + "loss": 0.06617764234542847, + "mean_token_accuracy": 0.977179691577569, + "num_tokens": 7518110.0, + "step": 3220 + }, + { + "epoch": 8.009962640099626, + "eval_entropy": 0.25100527677771656, + "eval_loss": 0.8393343687057495, + "eval_mean_token_accuracy": 0.8522553132023922, + "eval_num_tokens": 7518110.0, + "eval_runtime": 85.8837, + "eval_samples_per_second": 16.01, + "eval_steps_per_second": 2.003, + "step": 3220 + }, + { + "entropy": 0.12788885813206435, + "epoch": 8.059775840597759, + "grad_norm": 0.16094881296157837, + "learning_rate": 2.50346301653812e-05, + "loss": 0.06274186968803405, + "mean_token_accuracy": 0.9766994707286358, + "num_tokens": 7565539.0, + "step": 3240 + }, + { + "epoch": 8.059775840597759, + "eval_entropy": 0.24409458682287571, + "eval_loss": 0.874617338180542, + "eval_mean_token_accuracy": 0.8521041180505309, + "eval_num_tokens": 7565539.0, + "eval_runtime": 86.2656, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 3240 + }, + { + "entropy": 0.12464155335910618, + "epoch": 8.10958904109589, + "grad_norm": 0.16893954575061798, + "learning_rate": 2.381531506217437e-05, + "loss": 0.06093020439147949, + "mean_token_accuracy": 0.9776258453726768, + "num_tokens": 7612578.0, + "step": 3260 + }, + { + "epoch": 8.10958904109589, + "eval_entropy": 0.24396493017326953, + "eval_loss": 0.891161322593689, + "eval_mean_token_accuracy": 0.8515338024427724, + "eval_num_tokens": 7612578.0, + "eval_runtime": 85.9061, + "eval_samples_per_second": 16.006, + "eval_steps_per_second": 2.002, + "step": 3260 + }, + { + "entropy": 0.12345920228399336, + "epoch": 8.159402241594023, + "grad_norm": 0.14332273602485657, + "learning_rate": 2.262293898372616e-05, + "loss": 0.061289966106414795, + "mean_token_accuracy": 0.9762230902910233, + "num_tokens": 7660157.0, + "step": 3280 + }, + { + "epoch": 8.159402241594023, + "eval_entropy": 0.2481445314059424, + "eval_loss": 0.8922848105430603, + "eval_mean_token_accuracy": 0.8514944855556932, + "eval_num_tokens": 7660157.0, + "eval_runtime": 85.5201, + "eval_samples_per_second": 16.078, + "eval_steps_per_second": 2.011, + "step": 3280 + }, + { + "entropy": 0.12298110066913068, + "epoch": 8.209215442092155, + "grad_norm": 0.21848882734775543, + "learning_rate": 2.1457861534398633e-05, + "loss": 0.05986443758010864, + "mean_token_accuracy": 0.9786281704902648, + "num_tokens": 7709745.0, + "step": 3300 + }, + { + "epoch": 8.209215442092155, + "eval_entropy": 0.24329388124305149, + "eval_loss": 0.9021085500717163, + "eval_mean_token_accuracy": 0.8521762625422589, + "eval_num_tokens": 7709745.0, + "eval_runtime": 85.955, + "eval_samples_per_second": 15.997, + "eval_steps_per_second": 2.001, + "step": 3300 + }, + { + "entropy": 0.13265180448070168, + "epoch": 8.259028642590286, + "grad_norm": 0.18067947030067444, + "learning_rate": 2.0320434085659692e-05, + "loss": 0.06724961400032044, + "mean_token_accuracy": 0.975098168104887, + "num_tokens": 7753571.0, + "step": 3320 + }, + { + "epoch": 8.259028642590286, + "eval_entropy": 0.2433211464694766, + "eval_loss": 0.9094350337982178, + "eval_mean_token_accuracy": 0.8520150094531304, + "eval_num_tokens": 7753571.0, + "eval_runtime": 85.7989, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.005, + "step": 3320 + }, + { + "entropy": 0.11949320202693343, + "epoch": 8.308841843088418, + "grad_norm": 0.17020289599895477, + "learning_rate": 1.9210999670114196e-05, + "loss": 0.0634455680847168, + "mean_token_accuracy": 0.9771294385194779, + "num_tokens": 7799310.0, + "step": 3340 + }, + { + "epoch": 8.308841843088418, + "eval_entropy": 0.24345201219237128, + "eval_loss": 0.9021793603897095, + "eval_mean_token_accuracy": 0.8520745697409607, + "eval_num_tokens": 7799310.0, + "eval_runtime": 86.0883, + "eval_samples_per_second": 15.972, + "eval_steps_per_second": 1.998, + "step": 3340 + }, + { + "entropy": 0.12065747743472457, + "epoch": 8.35865504358655, + "grad_norm": 0.16789060831069946, + "learning_rate": 1.8129892878049886e-05, + "loss": 0.061494195461273195, + "mean_token_accuracy": 0.9779584899544715, + "num_tokens": 7846447.0, + "step": 3360 + }, + { + "epoch": 8.35865504358655, + "eval_entropy": 0.24093415042342142, + "eval_loss": 0.9006755352020264, + "eval_mean_token_accuracy": 0.852174230786257, + "eval_num_tokens": 7846447.0, + "eval_runtime": 85.9011, + "eval_samples_per_second": 16.007, + "eval_steps_per_second": 2.002, + "step": 3360 + }, + { + "entropy": 0.13125578537583352, + "epoch": 8.408468244084682, + "grad_norm": 0.1662452220916748, + "learning_rate": 1.70774397565298e-05, + "loss": 0.06685600876808166, + "mean_token_accuracy": 0.9744067586958408, + "num_tokens": 7890283.0, + "step": 3380 + }, + { + "epoch": 8.408468244084682, + "eval_entropy": 0.24062153688350388, + "eval_loss": 0.9078915119171143, + "eval_mean_token_accuracy": 0.8523201647886011, + "eval_num_tokens": 7890283.0, + "eval_runtime": 86.0201, + "eval_samples_per_second": 15.985, + "eval_steps_per_second": 2.0, + "step": 3380 + }, + { + "entropy": 0.11986117120832204, + "epoch": 8.458281444582815, + "grad_norm": 0.19571948051452637, + "learning_rate": 1.6053957711060606e-05, + "loss": 0.06411095261573792, + "mean_token_accuracy": 0.9770627245306969, + "num_tokens": 7936518.0, + "step": 3400 + }, + { + "epoch": 8.458281444582815, + "eval_entropy": 0.24352820347561394, + "eval_loss": 0.9058943390846252, + "eval_mean_token_accuracy": 0.8519382792156797, + "eval_num_tokens": 7936518.0, + "eval_runtime": 85.966, + "eval_samples_per_second": 15.995, + "eval_steps_per_second": 2.001, + "step": 3400 + }, + { + "entropy": 0.12857897616922856, + "epoch": 8.508094645080947, + "grad_norm": 0.2609264850616455, + "learning_rate": 1.5059755409867613e-05, + "loss": 0.06473397612571716, + "mean_token_accuracy": 0.9764650195837021, + "num_tokens": 7981966.0, + "step": 3420 + }, + { + "epoch": 8.508094645080947, + "eval_entropy": 0.24032609000108962, + "eval_loss": 0.9077776074409485, + "eval_mean_token_accuracy": 0.8517829197090726, + "eval_num_tokens": 7981966.0, + "eval_runtime": 86.6059, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 3420 + }, + { + "entropy": 0.12348870886489749, + "epoch": 8.557907845579079, + "grad_norm": 0.19537609815597534, + "learning_rate": 1.409513269080473e-05, + "loss": 0.06481348872184753, + "mean_token_accuracy": 0.9769559659063816, + "num_tokens": 8028367.0, + "step": 3440 + }, + { + "epoch": 8.557907845579079, + "eval_entropy": 0.2404322574824788, + "eval_loss": 0.9057720899581909, + "eval_mean_token_accuracy": 0.8521037981953732, + "eval_num_tokens": 8028367.0, + "eval_runtime": 86.166, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.996, + "step": 3440 + }, + { + "entropy": 0.12040232736617326, + "epoch": 8.607721046077211, + "grad_norm": 0.3310582935810089, + "learning_rate": 1.3160380470927183e-05, + "loss": 0.06468871235847473, + "mean_token_accuracy": 0.9768650442361831, + "num_tokens": 8074934.0, + "step": 3460 + }, + { + "epoch": 8.607721046077211, + "eval_entropy": 0.24118655876711356, + "eval_loss": 0.9028318524360657, + "eval_mean_token_accuracy": 0.8521025340224422, + "eval_num_tokens": 8074934.0, + "eval_runtime": 85.3668, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.015, + "step": 3460 + }, + { + "entropy": 0.12328103906475008, + "epoch": 8.657534246575342, + "grad_norm": 0.12836167216300964, + "learning_rate": 1.2255780658755122e-05, + "loss": 0.06229386329650879, + "mean_token_accuracy": 0.9763277888298034, + "num_tokens": 8122775.0, + "step": 3480 + }, + { + "epoch": 8.657534246575342, + "eval_entropy": 0.24194598145956217, + "eval_loss": 0.9009329080581665, + "eval_mean_token_accuracy": 0.8521693289973015, + "eval_num_tokens": 8122775.0, + "eval_runtime": 85.9415, + "eval_samples_per_second": 15.999, + "eval_steps_per_second": 2.001, + "step": 3480 + }, + { + "entropy": 0.11321646976284683, + "epoch": 8.707347447073474, + "grad_norm": 0.15656894445419312, + "learning_rate": 1.1381606069253786e-05, + "loss": 0.05908188819885254, + "mean_token_accuracy": 0.9779504477977753, + "num_tokens": 8174307.0, + "step": 3500 + }, + { + "epoch": 8.707347447073474, + "eval_entropy": 0.24121542517528977, + "eval_loss": 0.9016091823577881, + "eval_mean_token_accuracy": 0.8521790667328724, + "eval_num_tokens": 8174307.0, + "eval_runtime": 85.7465, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.006, + "step": 3500 + }, + { + "entropy": 0.12657046681270004, + "epoch": 8.757160647571606, + "grad_norm": 0.22597502171993256, + "learning_rate": 1.053812034155629e-05, + "loss": 0.06244581937789917, + "mean_token_accuracy": 0.976795207709074, + "num_tokens": 8222808.0, + "step": 3520 + }, + { + "epoch": 8.757160647571606, + "eval_entropy": 0.23877542708502258, + "eval_loss": 0.9069110155105591, + "eval_mean_token_accuracy": 0.8522880177858264, + "eval_num_tokens": 8222808.0, + "eval_runtime": 85.7792, + "eval_samples_per_second": 16.03, + "eval_steps_per_second": 2.005, + "step": 3520 + }, + { + "entropy": 0.11422101808711886, + "epoch": 8.806973848069738, + "grad_norm": 0.21139323711395264, + "learning_rate": 9.725577859453502e-06, + "loss": 0.05988085865974426, + "mean_token_accuracy": 0.9779510758817196, + "num_tokens": 8273335.0, + "step": 3540 + }, + { + "epoch": 8.806973848069738, + "eval_entropy": 0.2393161087881687, + "eval_loss": 0.9033801555633545, + "eval_mean_token_accuracy": 0.8522614209457885, + "eval_num_tokens": 8273335.0, + "eval_runtime": 85.5594, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 3540 + }, + { + "entropy": 0.13810604228638113, + "epoch": 8.85678704856787, + "grad_norm": 0.24571993947029114, + "learning_rate": 8.944223674675537e-06, + "loss": 0.07036117911338806, + "mean_token_accuracy": 0.9734892748296261, + "num_tokens": 8315235.0, + "step": 3560 + }, + { + "epoch": 8.85678704856787, + "eval_entropy": 0.23998506947658782, + "eval_loss": 0.9009848833084106, + "eval_mean_token_accuracy": 0.8521793619837872, + "eval_num_tokens": 8315235.0, + "eval_runtime": 86.0974, + "eval_samples_per_second": 15.97, + "eval_steps_per_second": 1.998, + "step": 3560 + }, + { + "entropy": 0.14193559321574867, + "epoch": 8.906600249066003, + "grad_norm": 0.17304112017154694, + "learning_rate": 8.194293432987386e-06, + "loss": 0.07077967524528503, + "mean_token_accuracy": 0.973305893689394, + "num_tokens": 8358099.0, + "step": 3580 + }, + { + "epoch": 8.906600249066003, + "eval_entropy": 0.23883876689644748, + "eval_loss": 0.9015622138977051, + "eval_mean_token_accuracy": 0.8524864378363587, + "eval_num_tokens": 8358099.0, + "eval_runtime": 86.0089, + "eval_samples_per_second": 15.987, + "eval_steps_per_second": 2.0, + "step": 3580 + }, + { + "entropy": 0.11878943420015275, + "epoch": 8.956413449564135, + "grad_norm": 0.19075658917427063, + "learning_rate": 7.476013303121426e-06, + "loss": 0.060806107521057126, + "mean_token_accuracy": 0.9776863709092141, + "num_tokens": 8407430.0, + "step": 3600 + }, + { + "epoch": 8.956413449564135, + "eval_entropy": 0.23726526309931, + "eval_loss": 0.9060276746749878, + "eval_mean_token_accuracy": 0.8524192058762838, + "eval_num_tokens": 8407430.0, + "eval_runtime": 85.7252, + "eval_samples_per_second": 16.04, + "eval_steps_per_second": 2.006, + "step": 3600 + }, + { + "entropy": 0.1255835090787747, + "epoch": 9.004981320049813, + "grad_norm": 0.11608047038316727, + "learning_rate": 6.78959990856799e-06, + "loss": 0.06319612860679627, + "mean_token_accuracy": 0.9766685519462976, + "num_tokens": 8453175.0, + "step": 3620 + }, + { + "epoch": 9.004981320049813, + "eval_entropy": 0.2373251837006835, + "eval_loss": 0.9045722484588623, + "eval_mean_token_accuracy": 0.8525558363559634, + "eval_num_tokens": 8453175.0, + "eval_runtime": 85.7435, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.006, + "step": 3620 + }, + { + "entropy": 0.12587778437882663, + "epoch": 9.054794520547945, + "grad_norm": 0.1564614623785019, + "learning_rate": 6.135260262244683e-06, + "loss": 0.0630365788936615, + "mean_token_accuracy": 0.9777486085891723, + "num_tokens": 8497151.0, + "step": 3640 + }, + { + "epoch": 9.054794520547945, + "eval_entropy": 0.23559923721260803, + "eval_loss": 0.9120694398880005, + "eval_mean_token_accuracy": 0.8525292966947999, + "eval_num_tokens": 8497151.0, + "eval_runtime": 85.8018, + "eval_samples_per_second": 16.025, + "eval_steps_per_second": 2.005, + "step": 3640 + }, + { + "entropy": 0.12535365503281354, + "epoch": 9.104607721046078, + "grad_norm": 0.1404249221086502, + "learning_rate": 5.513191704064086e-06, + "loss": 0.060502654314041136, + "mean_token_accuracy": 0.9770058333873749, + "num_tokens": 8542996.0, + "step": 3660 + }, + { + "epoch": 9.104607721046078, + "eval_entropy": 0.23525122691725575, + "eval_loss": 0.9182237982749939, + "eval_mean_token_accuracy": 0.8524098333924316, + "eval_num_tokens": 8542996.0, + "eval_runtime": 85.9872, + "eval_samples_per_second": 15.991, + "eval_steps_per_second": 2.0, + "step": 3660 + }, + { + "entropy": 0.11330419047735632, + "epoch": 9.15442092154421, + "grad_norm": 0.15513843297958374, + "learning_rate": 4.92358184141876e-06, + "loss": 0.05822383761405945, + "mean_token_accuracy": 0.9793384782969952, + "num_tokens": 8591625.0, + "step": 3680 + }, + { + "epoch": 9.15442092154421, + "eval_entropy": 0.2353947116711805, + "eval_loss": 0.9229223132133484, + "eval_mean_token_accuracy": 0.852500357253607, + "eval_num_tokens": 8591625.0, + "eval_runtime": 86.0805, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.998, + "step": 3680 + }, + { + "entropy": 0.11830627010203898, + "epoch": 9.204234122042342, + "grad_norm": 0.1730550080537796, + "learning_rate": 4.366608492601456e-06, + "loss": 0.05860854983329773, + "mean_token_accuracy": 0.9779663667082786, + "num_tokens": 8639845.0, + "step": 3700 + }, + { + "epoch": 9.204234122042342, + "eval_entropy": 0.23567205719476522, + "eval_loss": 0.9269373416900635, + "eval_mean_token_accuracy": 0.8523658004611038, + "eval_num_tokens": 8639845.0, + "eval_runtime": 85.9809, + "eval_samples_per_second": 15.992, + "eval_steps_per_second": 2.0, + "step": 3700 + }, + { + "entropy": 0.1180900705512613, + "epoch": 9.254047322540472, + "grad_norm": 0.20909737050533295, + "learning_rate": 3.842439633177387e-06, + "loss": 0.059438884258270264, + "mean_token_accuracy": 0.9786856278777123, + "num_tokens": 8687194.0, + "step": 3720 + }, + { + "epoch": 9.254047322540472, + "eval_entropy": 0.23602714493524196, + "eval_loss": 0.9293538928031921, + "eval_mean_token_accuracy": 0.8523273440294488, + "eval_num_tokens": 8687194.0, + "eval_runtime": 85.2118, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.019, + "step": 3720 + }, + { + "entropy": 0.13156692241318524, + "epoch": 9.303860523038605, + "grad_norm": 0.12535709142684937, + "learning_rate": 3.3512333453253305e-06, + "loss": 0.06337688565254211, + "mean_token_accuracy": 0.9756712593138218, + "num_tokens": 8731721.0, + "step": 3740 + }, + { + "epoch": 9.303860523038605, + "eval_entropy": 0.23534389351343, + "eval_loss": 0.932999312877655, + "eval_mean_token_accuracy": 0.8523333925147389, + "eval_num_tokens": 8731721.0, + "eval_runtime": 85.953, + "eval_samples_per_second": 15.997, + "eval_steps_per_second": 2.001, + "step": 3740 + }, + { + "entropy": 0.12327516414225101, + "epoch": 9.353673723536737, + "grad_norm": 0.16341575980186462, + "learning_rate": 2.8931377701619306e-06, + "loss": 0.05869622826576233, + "mean_token_accuracy": 0.9784224212169648, + "num_tokens": 8778614.0, + "step": 3760 + }, + { + "epoch": 9.353673723536737, + "eval_entropy": 0.23493653622477553, + "eval_loss": 0.9358566999435425, + "eval_mean_token_accuracy": 0.8522722783476807, + "eval_num_tokens": 8778614.0, + "eval_runtime": 85.2538, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.018, + "step": 3760 + }, + { + "entropy": 0.1134357453789562, + "epoch": 9.403486924034869, + "grad_norm": 0.23999616503715515, + "learning_rate": 2.4682910630645723e-06, + "loss": 0.057540220022201535, + "mean_token_accuracy": 0.9798057802021504, + "num_tokens": 8826551.0, + "step": 3780 + }, + { + "epoch": 9.403486924034869, + "eval_entropy": 0.23470525634150172, + "eval_loss": 0.937556266784668, + "eval_mean_token_accuracy": 0.8523351706044618, + "eval_num_tokens": 8826551.0, + "eval_runtime": 85.7764, + "eval_samples_per_second": 16.03, + "eval_steps_per_second": 2.005, + "step": 3780 + }, + { + "entropy": 0.1075570048764348, + "epoch": 9.453300124533001, + "grad_norm": 0.15417765080928802, + "learning_rate": 2.0768213520055406e-06, + "loss": 0.05581026673316956, + "mean_token_accuracy": 0.9797527104616165, + "num_tokens": 8876556.0, + "step": 3800 + }, + { + "epoch": 9.453300124533001, + "eval_entropy": 0.2347462713545145, + "eval_loss": 0.9383137226104736, + "eval_mean_token_accuracy": 0.8522575324357942, + "eval_num_tokens": 8876556.0, + "eval_runtime": 85.8985, + "eval_samples_per_second": 16.007, + "eval_steps_per_second": 2.002, + "step": 3800 + }, + { + "entropy": 0.12609313456341625, + "epoch": 9.503113325031133, + "grad_norm": 0.22041426599025726, + "learning_rate": 1.7188466989102739e-06, + "loss": 0.06379218697547913, + "mean_token_accuracy": 0.9763593293726445, + "num_tokens": 8920286.0, + "step": 3820 + }, + { + "epoch": 9.503113325031133, + "eval_entropy": 0.23459658849724505, + "eval_loss": 0.9393337965011597, + "eval_mean_token_accuracy": 0.8523633532052817, + "eval_num_tokens": 8920286.0, + "eval_runtime": 85.9348, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.002, + "step": 3820 + }, + { + "entropy": 0.12149709439836442, + "epoch": 9.552926525529266, + "grad_norm": 0.16608643531799316, + "learning_rate": 1.3944750640516357e-06, + "loss": 0.06341606974601746, + "mean_token_accuracy": 0.9771503552794456, + "num_tokens": 8964464.0, + "step": 3840 + }, + { + "epoch": 9.552926525529266, + "eval_entropy": 0.2347291322468325, + "eval_loss": 0.9399036765098572, + "eval_mean_token_accuracy": 0.8523768914300341, + "eval_num_tokens": 8964464.0, + "eval_runtime": 86.1305, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.997, + "step": 3840 + }, + { + "entropy": 0.11724846777506173, + "epoch": 9.602739726027398, + "grad_norm": 0.13613300025463104, + "learning_rate": 1.103804273490497e-06, + "loss": 0.05994418263435364, + "mean_token_accuracy": 0.9778759330511093, + "num_tokens": 9010414.0, + "step": 3860 + }, + { + "epoch": 9.602739726027398, + "eval_entropy": 0.23495923337894817, + "eval_loss": 0.9400841593742371, + "eval_mean_token_accuracy": 0.8523780471363733, + "eval_num_tokens": 9010414.0, + "eval_runtime": 86.0379, + "eval_samples_per_second": 15.981, + "eval_steps_per_second": 1.999, + "step": 3860 + }, + { + "entropy": 0.12054574331268668, + "epoch": 9.65255292652553, + "grad_norm": 0.11884245276451111, + "learning_rate": 8.469219895727582e-07, + "loss": 0.05917409062385559, + "mean_token_accuracy": 0.9771256923675538, + "num_tokens": 9058053.0, + "step": 3880 + }, + { + "epoch": 9.65255292652553, + "eval_entropy": 0.23499552723626757, + "eval_loss": 0.9404177665710449, + "eval_mean_token_accuracy": 0.8523571678372317, + "eval_num_tokens": 9058053.0, + "eval_runtime": 86.0174, + "eval_samples_per_second": 15.985, + "eval_steps_per_second": 2.0, + "step": 3880 + }, + { + "entropy": 0.12163264504633844, + "epoch": 9.70236612702366, + "grad_norm": 0.18393972516059875, + "learning_rate": 6.239056844915407e-07, + "loss": 0.059613007307052615, + "mean_token_accuracy": 0.9776720523834228, + "num_tokens": 9105574.0, + "step": 3900 + }, + { + "epoch": 9.70236612702366, + "eval_entropy": 0.23491846319547918, + "eval_loss": 0.9405836462974548, + "eval_mean_token_accuracy": 0.8523543633000795, + "eval_num_tokens": 9105574.0, + "eval_runtime": 85.9519, + "eval_samples_per_second": 15.997, + "eval_steps_per_second": 2.001, + "step": 3900 + }, + { + "entropy": 0.11569633753970265, + "epoch": 9.752179327521793, + "grad_norm": 0.1553788185119629, + "learning_rate": 4.3482261692267186e-07, + "loss": 0.05866732001304627, + "mean_token_accuracy": 0.9790047742426395, + "num_tokens": 9152793.0, + "step": 3920 + }, + { + "epoch": 9.752179327521793, + "eval_entropy": 0.23489533165513082, + "eval_loss": 0.9410145878791809, + "eval_mean_token_accuracy": 0.8524025068726651, + "eval_num_tokens": 9152793.0, + "eval_runtime": 85.5221, + "eval_samples_per_second": 16.078, + "eval_steps_per_second": 2.011, + "step": 3920 + }, + { + "entropy": 0.12030278495512903, + "epoch": 9.801992528019925, + "grad_norm": 0.20454250276088715, + "learning_rate": 2.797298117403634e-07, + "loss": 0.061210107803344724, + "mean_token_accuracy": 0.9774218738079071, + "num_tokens": 9199382.0, + "step": 3940 + }, + { + "epoch": 9.801992528019925, + "eval_entropy": 0.2348609700105911, + "eval_loss": 0.9410302639007568, + "eval_mean_token_accuracy": 0.8523409498292346, + "eval_num_tokens": 9199382.0, + "eval_runtime": 85.9105, + "eval_samples_per_second": 16.005, + "eval_steps_per_second": 2.002, + "step": 3940 + }, + { + "entropy": 0.11162231937050819, + "epoch": 9.851805728518057, + "grad_norm": 0.13079790771007538, + "learning_rate": 1.5867404281932237e-07, + "loss": 0.05349419116973877, + "mean_token_accuracy": 0.9791230395436287, + "num_tokens": 9251912.0, + "step": 3960 + }, + { + "epoch": 9.851805728518057, + "eval_entropy": 0.23484029950097549, + "eval_loss": 0.9411523342132568, + "eval_mean_token_accuracy": 0.8523351938225502, + "eval_num_tokens": 9251912.0, + "eval_runtime": 85.1298, + "eval_samples_per_second": 16.152, + "eval_steps_per_second": 2.02, + "step": 3960 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.906717639286395e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3980/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3980/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3980/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3980/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3980/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3980/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3980/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3980/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3980/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3980/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3980/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3980/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3980/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3980/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..ce7180b7b8256b337de4fda1aea9f092b09530c8 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3980/trainer_state.json @@ -0,0 +1,4213 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 9.90161892901619, + "eval_steps": 20, + "global_step": 3980, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + }, + { + "entropy": 0.561330484598875, + "epoch": 1.891656288916563, + "grad_norm": 0.6722865700721741, + "learning_rate": 0.0002208867897174789, + "loss": 0.499837589263916, + "mean_token_accuracy": 0.8518734864890576, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.5865232653396074, + "eval_loss": 0.5437926650047302, + "eval_mean_token_accuracy": 0.8450997017843779, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4116, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.547389242425561, + "epoch": 1.9414694894146949, + "grad_norm": 0.7935577034950256, + "learning_rate": 0.00022027119820226907, + "loss": 0.4977591514587402, + "mean_token_accuracy": 0.8539491161704064, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.5290903090391048, + "eval_loss": 0.5409526824951172, + "eval_mean_token_accuracy": 0.8497545698354411, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.7262, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 780 + }, + { + "entropy": 0.5687909748405218, + "epoch": 1.9912826899128269, + "grad_norm": 0.6180546283721924, + "learning_rate": 0.00021962329729698345, + "loss": 0.5109643459320068, + "mean_token_accuracy": 0.8521598495543004, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.5503541858390321, + "eval_loss": 0.5361555218696594, + "eval_mean_token_accuracy": 0.8510884285666221, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.3339, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 800 + }, + { + "entropy": 0.4739728841261986, + "epoch": 2.0398505603985058, + "grad_norm": 0.8058829307556152, + "learning_rate": 0.0002189432823996982, + "loss": 0.4204097747802734, + "mean_token_accuracy": 0.8728981889211215, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.5077334992414297, + "eval_loss": 0.5531114339828491, + "eval_mean_token_accuracy": 0.8489257208136625, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.4801, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.989, + "step": 820 + }, + { + "entropy": 0.4594309840351343, + "epoch": 2.0896637608966375, + "grad_norm": 0.6906896829605103, + "learning_rate": 0.0002182313585936314, + "loss": 0.4071959495544434, + "mean_token_accuracy": 0.8732857562601566, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.49850136994622474, + "eval_loss": 0.5486204624176025, + "eval_mean_token_accuracy": 0.8507991450470548, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.3364, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.4881629109382629, + "epoch": 2.1394769613947697, + "grad_norm": 0.6343470215797424, + "learning_rate": 0.0002174877405852928, + "loss": 0.41669540405273436, + "mean_token_accuracy": 0.8711295068264008, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.49155513924914734, + "eval_loss": 0.555109441280365, + "eval_mean_token_accuracy": 0.8496399400539176, + "eval_num_tokens": 2008562.0, + "eval_runtime": 86.3295, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 860 + }, + { + "entropy": 0.4648668970912695, + "epoch": 2.1892901618929015, + "grad_norm": 0.8014165163040161, + "learning_rate": 0.00021671265263973133, + "loss": 0.4110250473022461, + "mean_token_accuracy": 0.8754166305065155, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.4909258722219356, + "eval_loss": 0.5539511442184448, + "eval_mean_token_accuracy": 0.8492401502160138, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.3468, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 880 + }, + { + "entropy": 0.4824485514312983, + "epoch": 2.2391033623910337, + "grad_norm": 0.6665191054344177, + "learning_rate": 0.00021590632851289967, + "loss": 0.4181404113769531, + "mean_token_accuracy": 0.8726993151009083, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.4986876940657926, + "eval_loss": 0.547695517539978, + "eval_mean_token_accuracy": 0.8501384708770486, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.3838, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 900 + }, + { + "entropy": 0.4751896943897009, + "epoch": 2.2889165628891655, + "grad_norm": 0.81158047914505, + "learning_rate": 0.00021506901138115678, + "loss": 0.40689678192138673, + "mean_token_accuracy": 0.8745221219956875, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.507153491121392, + "eval_loss": 0.5501641631126404, + "eval_mean_token_accuracy": 0.8495670116918032, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.0912, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 920 + }, + { + "entropy": 0.4873133715242147, + "epoch": 2.3387297633872977, + "grad_norm": 0.7218056321144104, + "learning_rate": 0.0002142009537679292, + "loss": 0.42701358795166017, + "mean_token_accuracy": 0.8695114746689796, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5202612736543943, + "eval_loss": 0.5491839051246643, + "eval_mean_token_accuracy": 0.8494071208460386, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.1142, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 940 + }, + { + "entropy": 0.4762951169162989, + "epoch": 2.3885429638854294, + "grad_norm": 0.7194424867630005, + "learning_rate": 0.0002133024174675534, + "loss": 0.42299847602844237, + "mean_token_accuracy": 0.8709790132939815, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4899340462546016, + "eval_loss": 0.5522511601448059, + "eval_mean_token_accuracy": 0.8492208258357159, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.463, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 960 + }, + { + "entropy": 0.49650347977876663, + "epoch": 2.4383561643835616, + "grad_norm": 0.8406022787094116, + "learning_rate": 0.0002123736734663221, + "loss": 0.4275330066680908, + "mean_token_accuracy": 0.8670595556497573, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.49691385654515996, + "eval_loss": 0.5491269826889038, + "eval_mean_token_accuracy": 0.850309816210769, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.17, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 980 + }, + { + "entropy": 0.48843890577554705, + "epoch": 2.488169364881694, + "grad_norm": 0.9082473516464233, + "learning_rate": 0.00021141500186075868, + "loss": 0.4309722423553467, + "mean_token_accuracy": 0.8686766296625137, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5543508351195691, + "eval_loss": 0.5478800535202026, + "eval_mean_token_accuracy": 0.8478029522784921, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.3835, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 1000 + }, + { + "entropy": 0.4777219031006098, + "epoch": 2.5379825653798256, + "grad_norm": 0.7448089122772217, + "learning_rate": 0.0002104266917731438, + "loss": 0.423325252532959, + "mean_token_accuracy": 0.8706337086856365, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.49857561550168106, + "eval_loss": 0.5511948466300964, + "eval_mean_token_accuracy": 0.8502220289651737, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.5399, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.988, + "step": 1020 + }, + { + "entropy": 0.4844174191355705, + "epoch": 2.587795765877958, + "grad_norm": 0.794029176235199, + "learning_rate": 0.00020940904126432, + "loss": 0.4176753044128418, + "mean_token_accuracy": 0.873535567522049, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.485467542222766, + "eval_loss": 0.5539286732673645, + "eval_mean_token_accuracy": 0.8495475081510322, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.135, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 1.997, + "step": 1040 + }, + { + "entropy": 0.49070929251611234, + "epoch": 2.6376089663760895, + "grad_norm": 0.7558256983757019, + "learning_rate": 0.0002083623572438007, + "loss": 0.42867293357849123, + "mean_token_accuracy": 0.8696666076779366, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.490822730889154, + "eval_loss": 0.5434785485267639, + "eval_mean_token_accuracy": 0.850568296950917, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.4933, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 1060 + }, + { + "entropy": 0.47806114703416824, + "epoch": 2.6874221668742218, + "grad_norm": 0.6608979105949402, + "learning_rate": 0.00020728695537721047, + "loss": 0.4289727687835693, + "mean_token_accuracy": 0.8693130135536193, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.5285773256490397, + "eval_loss": 0.5444230437278748, + "eval_mean_token_accuracy": 0.8498796481032704, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.7091, + "eval_samples_per_second": 15.858, + "eval_steps_per_second": 1.984, + "step": 1080 + }, + { + "entropy": 0.5046216730028391, + "epoch": 2.7372353673723535, + "grad_norm": 0.8428544998168945, + "learning_rate": 0.00020618315999108454, + "loss": 0.43131070137023925, + "mean_token_accuracy": 0.8701941035687923, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.49888394738352576, + "eval_loss": 0.5459766387939453, + "eval_mean_token_accuracy": 0.8511758872935938, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.2222, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.995, + "step": 1100 + }, + { + "entropy": 0.5212558470666409, + "epoch": 2.7870485678704857, + "grad_norm": 1.129318118095398, + "learning_rate": 0.00020505130397505635, + "loss": 0.44249300956726073, + "mean_token_accuracy": 0.8654101334512234, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5179622324053631, + "eval_loss": 0.5522801280021667, + "eval_mean_token_accuracy": 0.8497019947268242, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.1903, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.996, + "step": 1120 + }, + { + "entropy": 0.4988406613469124, + "epoch": 2.8368617683686175, + "grad_norm": 0.6460545063018799, + "learning_rate": 0.00020389172868146263, + "loss": 0.4386270523071289, + "mean_token_accuracy": 0.8690383620560169, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.5042278484203094, + "eval_loss": 0.5433034300804138, + "eval_mean_token_accuracy": 0.8497674451317898, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.3028, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.993, + "step": 1140 + }, + { + "entropy": 0.4926559619605541, + "epoch": 2.8866749688667497, + "grad_norm": 0.8199329972267151, + "learning_rate": 0.00020270478382239615, + "loss": 0.4313485145568848, + "mean_token_accuracy": 0.8674727231264114, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.503873193160046, + "eval_loss": 0.5388111472129822, + "eval_mean_token_accuracy": 0.8526195034731266, + "eval_num_tokens": 2710196.0, + "eval_runtime": 86.4054, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.991, + "step": 1160 + }, + { + "entropy": 0.5020013231784105, + "epoch": 2.936488169364882, + "grad_norm": 0.7344821095466614, + "learning_rate": 0.00020149082736423723, + "loss": 0.43590536117553713, + "mean_token_accuracy": 0.8671772189438343, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5368241809828337, + "eval_loss": 0.5355703830718994, + "eval_mean_token_accuracy": 0.8517617773871089, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.2945, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1180 + }, + { + "entropy": 0.5112275708466768, + "epoch": 2.9863013698630136, + "grad_norm": 0.6951606869697571, + "learning_rate": 0.00020025022541969622, + "loss": 0.43579301834106443, + "mean_token_accuracy": 0.8641206480562686, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.5066795706055885, + "eval_loss": 0.5415249466896057, + "eval_mean_token_accuracy": 0.8493563373421513, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.5005, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.988, + "step": 1200 + }, + { + "entropy": 0.42298635305502474, + "epoch": 3.0348692403486925, + "grad_norm": 0.8201794028282166, + "learning_rate": 0.00019898335213739863, + "loss": 0.35593905448913576, + "mean_token_accuracy": 0.889238600547497, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.4584170470750609, + "eval_loss": 0.569487452507019, + "eval_mean_token_accuracy": 0.8495814173027526, + "eval_num_tokens": 2848509.0, + "eval_runtime": 86.2281, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 1220 + }, + { + "entropy": 0.37450140453875064, + "epoch": 3.0846824408468243, + "grad_norm": 0.7308394908905029, + "learning_rate": 0.0001976905895890471, + "loss": 0.307823920249939, + "mean_token_accuracy": 0.9001288741827012, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.45185995916294497, + "eval_loss": 0.5672881603240967, + "eval_mean_token_accuracy": 0.8511318519364955, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.0819, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.998, + "step": 1240 + }, + { + "entropy": 0.3887945845723152, + "epoch": 3.1344956413449565, + "grad_norm": 0.7299330830574036, + "learning_rate": 0.0001963723276541939, + "loss": 0.32047903537750244, + "mean_token_accuracy": 0.8960984498262405, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.44865354549053105, + "eval_loss": 0.5666037201881409, + "eval_mean_token_accuracy": 0.8496572649063066, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 1260 + }, + { + "entropy": 0.39677664265036583, + "epoch": 3.1843088418430883, + "grad_norm": 0.9533219933509827, + "learning_rate": 0.00019502896390265838, + "loss": 0.3253983497619629, + "mean_token_accuracy": 0.8964207418262958, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.4641980809527774, + "eval_loss": 0.5814996957778931, + "eval_mean_token_accuracy": 0.8485886212005171, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.7784, + "eval_samples_per_second": 15.845, + "eval_steps_per_second": 1.982, + "step": 1280 + }, + { + "entropy": 0.39210722744464876, + "epoch": 3.2341220423412205, + "grad_norm": 0.7447651028633118, + "learning_rate": 0.00019366090347462545, + "loss": 0.3276803970336914, + "mean_token_accuracy": 0.8930055953562259, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43595615254585135, + "eval_loss": 0.5722188353538513, + "eval_mean_token_accuracy": 0.8501105755567551, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.5271, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 1300 + }, + { + "entropy": 0.3684127271175385, + "epoch": 3.2839352428393527, + "grad_norm": 0.6934201121330261, + "learning_rate": 0.00019226855895846078, + "loss": 0.3156379222869873, + "mean_token_accuracy": 0.8976306475698947, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.4628148723480313, + "eval_loss": 0.5631352066993713, + "eval_mean_token_accuracy": 0.8504934813394103, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.3436, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 1320 + }, + { + "entropy": 0.4073401909321547, + "epoch": 3.3337484433374844, + "grad_norm": 0.9386897683143616, + "learning_rate": 0.00019085235026627994, + "loss": 0.34265310764312745, + "mean_token_accuracy": 0.8902062118053437, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.46455050623694133, + "eval_loss": 0.5586736798286438, + "eval_mean_token_accuracy": 0.8506874702004499, + "eval_num_tokens": 3132874.0, + "eval_runtime": 86.1286, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.997, + "step": 1340 + }, + { + "entropy": 0.4046429242938757, + "epoch": 3.383561643835616, + "grad_norm": 0.9633992314338684, + "learning_rate": 0.00018941270450730836, + "loss": 0.33816893100738527, + "mean_token_accuracy": 0.8927541889250279, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.46846531660750856, + "eval_loss": 0.561501681804657, + "eval_mean_token_accuracy": 0.8496256377114806, + "eval_num_tokens": 3178055.0, + "eval_runtime": 86.685, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1360 + }, + { + "entropy": 0.39872407019138334, + "epoch": 3.4333748443337484, + "grad_norm": 0.7786458730697632, + "learning_rate": 0.00018795005585907113, + "loss": 0.33342490196228025, + "mean_token_accuracy": 0.8944805048406124, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.42709505973860273, + "eval_loss": 0.5751848220825195, + "eval_mean_token_accuracy": 0.8507290447867194, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.6892, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 1380 + }, + { + "entropy": 0.3923338124528527, + "epoch": 3.4831880448318806, + "grad_norm": 0.9305956363677979, + "learning_rate": 0.0001864648454364511, + "loss": 0.33188116550445557, + "mean_token_accuracy": 0.8943330392241478, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.4386174779298694, + "eval_loss": 0.5680831074714661, + "eval_mean_token_accuracy": 0.8513129727784977, + "eval_num_tokens": 3274096.0, + "eval_runtime": 86.2671, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 1400 + }, + { + "entropy": 0.3856233984231949, + "epoch": 3.5330012453300124, + "grad_norm": 1.0362752676010132, + "learning_rate": 0.0001849575211586545, + "loss": 0.33098697662353516, + "mean_token_accuracy": 0.8961390435695649, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4574795474493226, + "eval_loss": 0.5630439519882202, + "eval_mean_token_accuracy": 0.8520988873964133, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.6035, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 1420 + }, + { + "entropy": 0.39812871962785723, + "epoch": 3.5828144458281446, + "grad_norm": 0.7807195782661438, + "learning_rate": 0.0001834285376141247, + "loss": 0.3333771228790283, + "mean_token_accuracy": 0.8930827379226685, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.4556825893909432, + "eval_loss": 0.5689062476158142, + "eval_mean_token_accuracy": 0.8507103507601937, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.1606, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.996, + "step": 1440 + }, + { + "entropy": 0.4147744856774807, + "epoch": 3.6326276463262763, + "grad_norm": 0.6429352164268494, + "learning_rate": 0.00018187835592344443, + "loss": 0.3482560873031616, + "mean_token_accuracy": 0.8910200245678425, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.46600024540757023, + "eval_loss": 0.5609709024429321, + "eval_mean_token_accuracy": 0.8491220876227977, + "eval_num_tokens": 3415600.0, + "eval_runtime": 86.8039, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1460 + }, + { + "entropy": 0.40425071083009245, + "epoch": 3.6824408468244085, + "grad_norm": 0.8613698482513428, + "learning_rate": 0.0001803074436002682, + "loss": 0.342916464805603, + "mean_token_accuracy": 0.8916418336331844, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.43855057899342026, + "eval_loss": 0.5720968246459961, + "eval_mean_token_accuracy": 0.8500823641932288, + "eval_num_tokens": 3460471.0, + "eval_runtime": 86.6746, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1480 + }, + { + "entropy": 0.39465143866837027, + "epoch": 3.7322540473225407, + "grad_norm": 0.6285189986228943, + "learning_rate": 0.0001787162744103265, + "loss": 0.3424591779708862, + "mean_token_accuracy": 0.8906558901071548, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4509461877304454, + "eval_loss": 0.5590082406997681, + "eval_mean_token_accuracy": 0.8511747371318729, + "eval_num_tokens": 3507647.0, + "eval_runtime": 86.8126, + "eval_samples_per_second": 15.839, + "eval_steps_per_second": 1.981, + "step": 1500 + }, + { + "entropy": 0.4021005939692259, + "epoch": 3.7820672478206725, + "grad_norm": 0.8821248412132263, + "learning_rate": 0.00017710532822854468, + "loss": 0.3462103843688965, + "mean_token_accuracy": 0.889109355956316, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.4502199075596277, + "eval_loss": 0.566046416759491, + "eval_mean_token_accuracy": 0.8501714208098345, + "eval_num_tokens": 3548934.0, + "eval_runtime": 86.8336, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.981, + "step": 1520 + }, + { + "entropy": 0.4017397932708263, + "epoch": 3.8318804483188043, + "grad_norm": 0.8400952816009521, + "learning_rate": 0.0001754750908943189, + "loss": 0.34890995025634763, + "mean_token_accuracy": 0.8892098367214203, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.4614003023435903, + "eval_loss": 0.5617933869361877, + "eval_mean_token_accuracy": 0.8515863616106122, + "eval_num_tokens": 3597186.0, + "eval_runtime": 86.4609, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 1540 + }, + { + "entropy": 0.4112051840871572, + "epoch": 3.8816936488169365, + "grad_norm": 0.769478440284729, + "learning_rate": 0.0001738260540649939, + "loss": 0.34711437225341796, + "mean_token_accuracy": 0.8911717928946018, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4540443811998811, + "eval_loss": 0.5576469898223877, + "eval_mean_token_accuracy": 0.8512079674144124, + "eval_num_tokens": 3646646.0, + "eval_runtime": 86.5103, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 1560 + }, + { + "entropy": 0.41105241514742374, + "epoch": 3.9315068493150687, + "grad_norm": 0.8468427062034607, + "learning_rate": 0.00017215871506758568, + "loss": 0.3433023452758789, + "mean_token_accuracy": 0.8898739732801915, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.4707539707075718, + "eval_loss": 0.5641466379165649, + "eval_mean_token_accuracy": 0.8495440957851188, + "eval_num_tokens": 3689560.0, + "eval_runtime": 86.609, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.986, + "step": 1580 + }, + { + "entropy": 0.41016379147768023, + "epoch": 3.9813200498132004, + "grad_norm": 0.7482675313949585, + "learning_rate": 0.0001704735767487946, + "loss": 0.34550890922546384, + "mean_token_accuracy": 0.8893028847873211, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.46391099864660307, + "eval_loss": 0.5593640804290771, + "eval_mean_token_accuracy": 0.8510130581467651, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.3975, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 1600 + }, + { + "entropy": 0.33167599791135544, + "epoch": 4.029887920298879, + "grad_norm": 0.9435692429542542, + "learning_rate": 0.00016877114732335337, + "loss": 0.2716026544570923, + "mean_token_accuracy": 0.9133149828666296, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.38499350005457567, + "eval_loss": 0.6298249363899231, + "eval_mean_token_accuracy": 0.8488117071778275, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.2933, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1620 + }, + { + "entropy": 0.3000166634097695, + "epoch": 4.0797011207970115, + "grad_norm": 0.8080845475196838, + "learning_rate": 0.0001670519402207569, + "loss": 0.22617182731628419, + "mean_token_accuracy": 0.9253474645316601, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.370110988703578, + "eval_loss": 0.6338461637496948, + "eval_mean_token_accuracy": 0.8485634801692741, + "eval_num_tokens": 3828830.0, + "eval_runtime": 85.9508, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.001, + "step": 1640 + }, + { + "entropy": 0.2986910421401262, + "epoch": 4.129514321295143, + "grad_norm": 0.7310900092124939, + "learning_rate": 0.0001653164739304185, + "loss": 0.22367463111877442, + "mean_token_accuracy": 0.9252275295555592, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.3944379702037157, + "eval_loss": 0.6109381914138794, + "eval_mean_token_accuracy": 0.849291454220927, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.6728, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1660 + }, + { + "entropy": 0.3095553796738386, + "epoch": 4.179327521793275, + "grad_norm": 0.7059140801429749, + "learning_rate": 0.0001635652718453007, + "loss": 0.23651680946350098, + "mean_token_accuracy": 0.9208931416273117, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.3910588648949945, + "eval_loss": 0.6104469299316406, + "eval_mean_token_accuracy": 0.8486883893262508, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7612, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.982, + "step": 1680 + }, + { + "entropy": 0.3001101028174162, + "epoch": 4.229140722291407, + "grad_norm": 0.6787802577018738, + "learning_rate": 0.00016179886210406728, + "loss": 0.23130471706390382, + "mean_token_accuracy": 0.9233332790434361, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3794369170832079, + "eval_loss": 0.6182110905647278, + "eval_mean_token_accuracy": 0.8495433777570724, + "eval_num_tokens": 3967474.0, + "eval_runtime": 85.94, + "eval_samples_per_second": 16.0, + "eval_steps_per_second": 2.001, + "step": 1700 + }, + { + "entropy": 0.3031421799212694, + "epoch": 4.2789539227895395, + "grad_norm": 0.9732038378715515, + "learning_rate": 0.0001600177774318036, + "loss": 0.2359529733657837, + "mean_token_accuracy": 0.9217648565769195, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3923123094231583, + "eval_loss": 0.6057384610176086, + "eval_mean_token_accuracy": 0.8508818288182103, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7647, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.29365369994193313, + "epoch": 4.328767123287671, + "grad_norm": 0.7681498527526855, + "learning_rate": 0.0001582225549793541, + "loss": 0.2269371747970581, + "mean_token_accuracy": 0.9245341829955578, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.4011661055129628, + "eval_loss": 0.6144486665725708, + "eval_mean_token_accuracy": 0.8480324357054955, + "eval_num_tokens": 4062594.0, + "eval_runtime": 87.1306, + "eval_samples_per_second": 15.781, + "eval_steps_per_second": 1.974, + "step": 1740 + }, + { + "entropy": 0.29396994728595016, + "epoch": 4.378580323785803, + "grad_norm": 1.0001007318496704, + "learning_rate": 0.0001564137361613248, + "loss": 0.22777395248413085, + "mean_token_accuracy": 0.9262309700250626, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38518730195802314, + "eval_loss": 0.6202630400657654, + "eval_mean_token_accuracy": 0.8493869807137999, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6616, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.3096018506214023, + "epoch": 4.428393524283935, + "grad_norm": 1.0448365211486816, + "learning_rate": 0.00015459186649280024, + "loss": 0.23696351051330566, + "mean_token_accuracy": 0.9217322513461113, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.3946371126140273, + "eval_loss": 0.6079026460647583, + "eval_mean_token_accuracy": 0.8492515852978063, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6582, + "eval_samples_per_second": 15.867, + "eval_steps_per_second": 1.985, + "step": 1780 + }, + { + "entropy": 0.32619857545942066, + "epoch": 4.478206724782067, + "grad_norm": 0.7210651636123657, + "learning_rate": 0.00015275749542482337, + "loss": 0.24651215076446534, + "mean_token_accuracy": 0.9177676141262054, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.3947690814560236, + "eval_loss": 0.6065912246704102, + "eval_mean_token_accuracy": 0.8502957744653835, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.5959, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.986, + "step": 1800 + }, + { + "entropy": 0.3193941755220294, + "epoch": 4.5280199252802, + "grad_norm": 0.8281906843185425, + "learning_rate": 0.0001509111761786888, + "loss": 0.23936262130737304, + "mean_token_accuracy": 0.9201708927750587, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38704028864239537, + "eval_loss": 0.6006569266319275, + "eval_mean_token_accuracy": 0.8502406720505205, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.8059, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1820 + }, + { + "entropy": 0.3164879363030195, + "epoch": 4.577833125778331, + "grad_norm": 0.7892968654632568, + "learning_rate": 0.00014905346557909867, + "loss": 0.24541733264923096, + "mean_token_accuracy": 0.9175932116806507, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.38861122120951497, + "eval_loss": 0.6115967631340027, + "eval_mean_token_accuracy": 0.849471275196519, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.2946, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1840 + }, + { + "entropy": 0.3051785985007882, + "epoch": 4.627646326276463, + "grad_norm": 0.8109654188156128, + "learning_rate": 0.0001471849238862319, + "loss": 0.23433220386505127, + "mean_token_accuracy": 0.9206570319831371, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.37162452295076015, + "eval_loss": 0.6184061765670776, + "eval_mean_token_accuracy": 0.8501173268223918, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.6865, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1860 + }, + { + "entropy": 0.3168198253959417, + "epoch": 4.677459526774595, + "grad_norm": 0.9512342214584351, + "learning_rate": 0.0001453061146267775, + "loss": 0.23832404613494873, + "mean_token_accuracy": 0.9197044663131237, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3845940856912801, + "eval_loss": 0.606762707233429, + "eval_mean_token_accuracy": 0.8504838194957999, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.5175, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 1880 + }, + { + "entropy": 0.30791807882487776, + "epoch": 4.7272727272727275, + "grad_norm": 0.8123113512992859, + "learning_rate": 0.00014341760442398248, + "loss": 0.2395785331726074, + "mean_token_accuracy": 0.918928150832653, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.39762327222283494, + "eval_loss": 0.5994202494621277, + "eval_mean_token_accuracy": 0.8509274201337681, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.2873, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.993, + "step": 1900 + }, + { + "entropy": 0.3021434534341097, + "epoch": 4.777085927770859, + "grad_norm": 0.731787383556366, + "learning_rate": 0.000141519962826766, + "loss": 0.23494718074798585, + "mean_token_accuracy": 0.9201403826475143, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.3827026732439219, + "eval_loss": 0.5995895862579346, + "eval_mean_token_accuracy": 0.851468373523202, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.3006, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 1920 + }, + { + "entropy": 0.31626159623265265, + "epoch": 4.826899128268991, + "grad_norm": 0.8848487138748169, + "learning_rate": 0.00013961376213795132, + "loss": 0.2439030647277832, + "mean_token_accuracy": 0.9196575872600079, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.388698436839636, + "eval_loss": 0.6000174283981323, + "eval_mean_token_accuracy": 0.8518068187458571, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.8979, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.979, + "step": 1940 + }, + { + "entropy": 0.30520407035946845, + "epoch": 4.876712328767123, + "grad_norm": 0.8532460927963257, + "learning_rate": 0.00013769957724166695, + "loss": 0.23458616733551024, + "mean_token_accuracy": 0.9221912942826748, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.38777847102908203, + "eval_loss": 0.6004981398582458, + "eval_mean_token_accuracy": 0.8516481768253238, + "eval_num_tokens": 4578167.0, + "eval_runtime": 87.0777, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.975, + "step": 1960 + }, + { + "entropy": 0.3226448342204094, + "epoch": 4.926525529265255, + "grad_norm": 0.6945561766624451, + "learning_rate": 0.0001357779854299694, + "loss": 0.24048397541046143, + "mean_token_accuracy": 0.9195300146937371, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.38581624263247777, + "eval_loss": 0.6029234528541565, + "eval_mean_token_accuracy": 0.8514213260523108, + "eval_num_tokens": 4622316.0, + "eval_runtime": 85.8729, + "eval_samples_per_second": 16.012, + "eval_steps_per_second": 2.003, + "step": 1980 + }, + { + "entropy": 0.3051655298098922, + "epoch": 4.976338729763388, + "grad_norm": 0.7976452708244324, + "learning_rate": 0.00013384956622874001, + "loss": 0.23584742546081544, + "mean_token_accuracy": 0.9216851457953453, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.37913159246361533, + "eval_loss": 0.6057604551315308, + "eval_mean_token_accuracy": 0.8525801203971686, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.1145, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 2000 + }, + { + "entropy": 0.27438195240803254, + "epoch": 5.024906600249066, + "grad_norm": 0.6729586124420166, + "learning_rate": 0.0001319149012229075, + "loss": 0.19775952100753785, + "mean_token_accuracy": 0.9339428559327737, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.3448961910813354, + "eval_loss": 0.6750120520591736, + "eval_mean_token_accuracy": 0.8487970232963562, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.1169, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 2020 + }, + { + "entropy": 0.21423916313797237, + "epoch": 5.074719800747198, + "grad_norm": 0.6934391856193542, + "learning_rate": 0.00012997457388105022, + "loss": 0.1439570426940918, + "mean_token_accuracy": 0.9528236843645572, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.3570949243771475, + "eval_loss": 0.6465504169464111, + "eval_mean_token_accuracy": 0.8490785547467166, + "eval_num_tokens": 4763269.0, + "eval_runtime": 85.9574, + "eval_samples_per_second": 15.996, + "eval_steps_per_second": 2.001, + "step": 2040 + }, + { + "entropy": 0.20838565267622472, + "epoch": 5.12453300124533, + "grad_norm": 0.7286986112594604, + "learning_rate": 0.00012802916937942972, + "loss": 0.14467307329177856, + "mean_token_accuracy": 0.950994835793972, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.3452463157821533, + "eval_loss": 0.6705958843231201, + "eval_mean_token_accuracy": 0.8490352796953778, + "eval_num_tokens": 4809047.0, + "eval_runtime": 86.228, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 2060 + }, + { + "entropy": 0.20453082229942082, + "epoch": 5.174346201743462, + "grad_norm": 0.7515555620193481, + "learning_rate": 0.00012607927442550974, + "loss": 0.13732000589370727, + "mean_token_accuracy": 0.9537357829511166, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.32431264914745506, + "eval_loss": 0.6743043065071106, + "eval_mean_token_accuracy": 0.8504878629085629, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.5948, + "eval_samples_per_second": 15.879, + "eval_steps_per_second": 1.986, + "step": 2080 + }, + { + "entropy": 0.21812320686876774, + "epoch": 5.224159402241594, + "grad_norm": 0.9093465209007263, + "learning_rate": 0.0001241254770810132, + "loss": 0.14311420917510986, + "mean_token_accuracy": 0.9514068141579628, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.33086285835435225, + "eval_loss": 0.6676449179649353, + "eval_mean_token_accuracy": 0.8505287662495015, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 2100 + }, + { + "entropy": 0.2180163251236081, + "epoch": 5.273972602739726, + "grad_norm": 0.6703007221221924, + "learning_rate": 0.00012216836658457075, + "loss": 0.14803968667984008, + "mean_token_accuracy": 0.9521303348243236, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.33162341708707255, + "eval_loss": 0.6658875942230225, + "eval_mean_token_accuracy": 0.8500757605530495, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.6296, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 2120 + }, + { + "entropy": 0.22511130161583423, + "epoch": 5.323785803237858, + "grad_norm": 0.8078880906105042, + "learning_rate": 0.00012020853317401455, + "loss": 0.15228408575057983, + "mean_token_accuracy": 0.947144789993763, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3354601170434508, + "eval_loss": 0.6677829623222351, + "eval_mean_token_accuracy": 0.8482600024273229, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.4689, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.989, + "step": 2140 + }, + { + "entropy": 0.2244176059961319, + "epoch": 5.37359900373599, + "grad_norm": 0.9636075496673584, + "learning_rate": 0.00011824656790837037, + "loss": 0.15260883569717407, + "mean_token_accuracy": 0.9471467643976211, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.3381616926297199, + "eval_loss": 0.6694412231445312, + "eval_mean_token_accuracy": 0.8482369603805764, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.4147, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 2160 + }, + { + "entropy": 0.22982364390045404, + "epoch": 5.423412204234122, + "grad_norm": 0.775401771068573, + "learning_rate": 0.00011628306248960262, + "loss": 0.15140302181243898, + "mean_token_accuracy": 0.9492553934454918, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.3305150235808173, + "eval_loss": 0.6717822551727295, + "eval_mean_token_accuracy": 0.8489849723355715, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.4728, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.989, + "step": 2180 + }, + { + "entropy": 0.21448935717344284, + "epoch": 5.473225404732254, + "grad_norm": 0.6575281023979187, + "learning_rate": 0.00011431860908416465, + "loss": 0.1452319622039795, + "mean_token_accuracy": 0.9505287684500218, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3488145174328671, + "eval_loss": 0.6612305641174316, + "eval_mean_token_accuracy": 0.8492907808963642, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6927, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 2200 + }, + { + "entropy": 0.23091202937066554, + "epoch": 5.523038605230386, + "grad_norm": 0.8909686207771301, + "learning_rate": 0.00011235380014440985, + "loss": 0.15150139331817628, + "mean_token_accuracy": 0.9497875183820724, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.3268539015810157, + "eval_loss": 0.6667542457580566, + "eval_mean_token_accuracy": 0.8499062903398691, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.4644, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 2220 + }, + { + "entropy": 0.2227974807843566, + "epoch": 5.572851805728518, + "grad_norm": 0.6180275082588196, + "learning_rate": 0.0001103892282299158, + "loss": 0.1491069197654724, + "mean_token_accuracy": 0.9488144010305405, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3346347655494546, + "eval_loss": 0.6665948629379272, + "eval_mean_token_accuracy": 0.8499961893918903, + "eval_num_tokens": 5226864.0, + "eval_runtime": 87.0548, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.976, + "step": 2240 + }, + { + "entropy": 0.21368421968072654, + "epoch": 5.62266500622665, + "grad_norm": 0.6004369258880615, + "learning_rate": 0.00010842548582877651, + "loss": 0.14485255479812623, + "mean_token_accuracy": 0.9502056457102299, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.32753298804163933, + "eval_loss": 0.6680151224136353, + "eval_mean_token_accuracy": 0.8515451086121936, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.8524, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.98, + "step": 2260 + }, + { + "entropy": 0.2103635374456644, + "epoch": 5.672478206724782, + "grad_norm": 0.699174702167511, + "learning_rate": 0.00010646316517891613, + "loss": 0.14297772645950318, + "mean_token_accuracy": 0.9512537539005279, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.32966585959806, + "eval_loss": 0.675578773021698, + "eval_mean_token_accuracy": 0.8509623023659684, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.4518, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.99, + "step": 2280 + }, + { + "entropy": 0.22516900151968003, + "epoch": 5.722291407222914, + "grad_norm": 0.6637354493141174, + "learning_rate": 0.00010450285808947797, + "loss": 0.15202572345733642, + "mean_token_accuracy": 0.9482452072203159, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3369456917740578, + "eval_loss": 0.6697061061859131, + "eval_mean_token_accuracy": 0.848603522361711, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.6371, + "eval_samples_per_second": 15.871, + "eval_steps_per_second": 1.985, + "step": 2300 + }, + { + "entropy": 0.21841065725311637, + "epoch": 5.772104607721046, + "grad_norm": 0.7940268516540527, + "learning_rate": 0.00010254515576234297, + "loss": 0.14710167646408082, + "mean_token_accuracy": 0.9493498183786869, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3237486180177955, + "eval_loss": 0.6779657602310181, + "eval_mean_token_accuracy": 0.8500715313955794, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.1826, + "eval_samples_per_second": 15.954, + "eval_steps_per_second": 1.996, + "step": 2320 + }, + { + "entropy": 0.22146204356104135, + "epoch": 5.821917808219178, + "grad_norm": 0.9234833121299744, + "learning_rate": 0.00010059064861383132, + "loss": 0.14720046520233154, + "mean_token_accuracy": 0.9493872679769992, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.32365207564692167, + "eval_loss": 0.6704005002975464, + "eval_mean_token_accuracy": 0.8507985760306203, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.5494, + "eval_samples_per_second": 15.887, + "eval_steps_per_second": 1.987, + "step": 2340 + }, + { + "entropy": 0.20934011954814197, + "epoch": 5.87173100871731, + "grad_norm": 0.5547503232955933, + "learning_rate": 9.863992609664084e-05, + "loss": 0.1464867353439331, + "mean_token_accuracy": 0.9503875687718392, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.3330401429083458, + "eval_loss": 0.6659091114997864, + "eval_mean_token_accuracy": 0.8504848906467127, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.5855, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 2360 + }, + { + "entropy": 0.21678635366261007, + "epoch": 5.921544209215442, + "grad_norm": 0.570612907409668, + "learning_rate": 9.669357652207635e-05, + "loss": 0.14821385145187377, + "mean_token_accuracy": 0.9503940217196941, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3322022325077722, + "eval_loss": 0.6722489595413208, + "eval_mean_token_accuracy": 0.8489979422369669, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.2986, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 2380 + }, + { + "entropy": 0.20932920072227718, + "epoch": 5.971357409713574, + "grad_norm": 0.7879557609558105, + "learning_rate": 9.475218688262262e-05, + "loss": 0.14675841331481934, + "mean_token_accuracy": 0.9507176131010056, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.3199348642902319, + "eval_loss": 0.6698136329650879, + "eval_mean_token_accuracy": 0.8514142130003419, + "eval_num_tokens": 5605400.0, + "eval_runtime": 85.8995, + "eval_samples_per_second": 16.007, + "eval_steps_per_second": 2.002, + "step": 2400 + }, + { + "entropy": 0.21032143919131693, + "epoch": 6.019925280199253, + "grad_norm": 0.5823076367378235, + "learning_rate": 9.281634267491569e-05, + "loss": 0.13322267532348633, + "mean_token_accuracy": 0.9550939072401096, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.30206270117399303, + "eval_loss": 0.7093168497085571, + "eval_mean_token_accuracy": 0.8500627639681794, + "eval_num_tokens": 5648968.0, + "eval_runtime": 85.8128, + "eval_samples_per_second": 16.023, + "eval_steps_per_second": 2.004, + "step": 2420 + }, + { + "entropy": 0.1534628233872354, + "epoch": 6.069738480697385, + "grad_norm": 0.710133969783783, + "learning_rate": 9.088662772316508e-05, + "loss": 0.09078952670097351, + "mean_token_accuracy": 0.9678447999060154, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.28208133101809857, + "eval_loss": 0.7636417150497437, + "eval_mean_token_accuracy": 0.8494061477655588, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9724, + "eval_samples_per_second": 15.994, + "eval_steps_per_second": 2.001, + "step": 2440 + }, + { + "entropy": 0.16151462448760867, + "epoch": 6.119551681195516, + "grad_norm": 0.5793812274932861, + "learning_rate": 8.896362400308028e-05, + "loss": 0.09545697569847107, + "mean_token_accuracy": 0.9671573750674725, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.2833245605403601, + "eval_loss": 0.7402405738830566, + "eval_mean_token_accuracy": 0.8503523728875226, + "eval_num_tokens": 5745090.0, + "eval_runtime": 85.5461, + "eval_samples_per_second": 16.073, + "eval_steps_per_second": 2.011, + "step": 2460 + }, + { + "entropy": 0.15203177919611335, + "epoch": 6.169364881693649, + "grad_norm": 0.4251123368740082, + "learning_rate": 8.704791146635483e-05, + "loss": 0.09420782327651978, + "mean_token_accuracy": 0.9677386932075024, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.28572545962971313, + "eval_loss": 0.735416829586029, + "eval_mean_token_accuracy": 0.8487084663884584, + "eval_num_tokens": 5790333.0, + "eval_runtime": 85.4801, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.012, + "step": 2480 + }, + { + "entropy": 0.15587336672469973, + "epoch": 6.219178082191781, + "grad_norm": 0.4357028007507324, + "learning_rate": 8.514006786576085e-05, + "loss": 0.09429320096969604, + "mean_token_accuracy": 0.9682952925562859, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.2859006894882335, + "eval_loss": 0.7347224950790405, + "eval_mean_token_accuracy": 0.8501905518215757, + "eval_num_tokens": 5837321.0, + "eval_runtime": 85.7578, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.006, + "step": 2500 + }, + { + "entropy": 0.15765639198943973, + "epoch": 6.268991282689913, + "grad_norm": 0.47331130504608154, + "learning_rate": 8.324066858090663e-05, + "loss": 0.09571113586425781, + "mean_token_accuracy": 0.9683481335639954, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.29231513846059176, + "eval_loss": 0.7392512559890747, + "eval_mean_token_accuracy": 0.8486633983462356, + "eval_num_tokens": 5884398.0, + "eval_runtime": 85.7846, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.005, + "step": 2520 + }, + { + "entropy": 0.16176860257983208, + "epoch": 6.318804483188045, + "grad_norm": 0.6142018437385559, + "learning_rate": 8.135028644470992e-05, + "loss": 0.09486144185066223, + "mean_token_accuracy": 0.9682316601276397, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.2851274753379267, + "eval_loss": 0.7520816922187805, + "eval_mean_token_accuracy": 0.8501113649717597, + "eval_num_tokens": 5929876.0, + "eval_runtime": 85.9425, + "eval_samples_per_second": 15.999, + "eval_steps_per_second": 2.001, + "step": 2540 + }, + { + "entropy": 0.15404034564271568, + "epoch": 6.3686176836861765, + "grad_norm": 0.6051287651062012, + "learning_rate": 7.946949157063964e-05, + "loss": 0.09280472993850708, + "mean_token_accuracy": 0.9684635892510414, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28802703563557114, + "eval_loss": 0.7439162135124207, + "eval_mean_token_accuracy": 0.8499851770872293, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.0703, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.998, + "step": 2560 + }, + { + "entropy": 0.15343588953837753, + "epoch": 6.418430884184309, + "grad_norm": 0.4823743402957916, + "learning_rate": 7.759885118077701e-05, + "loss": 0.09000591039657593, + "mean_token_accuracy": 0.9699928767979145, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2795634938533916, + "eval_loss": 0.7647850513458252, + "eval_mean_token_accuracy": 0.8503464397995971, + "eval_num_tokens": 6025380.0, + "eval_runtime": 85.8886, + "eval_samples_per_second": 16.009, + "eval_steps_per_second": 2.003, + "step": 2580 + }, + { + "entropy": 0.15740026142448188, + "epoch": 6.468244084682441, + "grad_norm": 0.5082696676254272, + "learning_rate": 7.57389294347494e-05, + "loss": 0.09191849827766418, + "mean_token_accuracy": 0.9692809768021107, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2913342311458532, + "eval_loss": 0.7518694996833801, + "eval_mean_token_accuracy": 0.8483168302580367, + "eval_num_tokens": 6073349.0, + "eval_runtime": 85.5761, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.01, + "step": 2600 + }, + { + "entropy": 0.15922069251537324, + "epoch": 6.518057285180573, + "grad_norm": 0.3995199501514435, + "learning_rate": 7.389028725958736e-05, + "loss": 0.09584367871284485, + "mean_token_accuracy": 0.9685114495456218, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.2863075934177221, + "eval_loss": 0.7539381384849548, + "eval_mean_token_accuracy": 0.8507507083027862, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.112, + "eval_samples_per_second": 15.968, + "eval_steps_per_second": 1.997, + "step": 2620 + }, + { + "entropy": 0.16197575423866512, + "epoch": 6.567870485678705, + "grad_norm": 0.534295380115509, + "learning_rate": 7.205348218055678e-05, + "loss": 0.0961170256137848, + "mean_token_accuracy": 0.9674530044198036, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.29021967315050057, + "eval_loss": 0.751198947429657, + "eval_mean_token_accuracy": 0.8509796344956686, + "eval_num_tokens": 6165523.0, + "eval_runtime": 85.7958, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.005, + "step": 2640 + }, + { + "entropy": 0.15261746793985367, + "epoch": 6.617683686176837, + "grad_norm": 0.5391237139701843, + "learning_rate": 7.022906815301673e-05, + "loss": 0.0926026999950409, + "mean_token_accuracy": 0.9695659473538398, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.29128045216202736, + "eval_loss": 0.7450292110443115, + "eval_mean_token_accuracy": 0.8498771443616512, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.3963, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 2660 + }, + { + "entropy": 0.16164180357009172, + "epoch": 6.667496886674969, + "grad_norm": 0.5767946243286133, + "learning_rate": 6.841759539535419e-05, + "loss": 0.09291981458663941, + "mean_token_accuracy": 0.9687136687338352, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2897637223088464, + "eval_loss": 0.7503410577774048, + "eval_mean_token_accuracy": 0.8503315164599308, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.0653, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.998, + "step": 2680 + }, + { + "entropy": 0.17062523355707526, + "epoch": 6.717310087173101, + "grad_norm": 0.4974168539047241, + "learning_rate": 6.661961022304563e-05, + "loss": 0.09713236689567566, + "mean_token_accuracy": 0.9661971725523472, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2765843396963075, + "eval_loss": 0.7604002356529236, + "eval_mean_token_accuracy": 0.8521115277395692, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.1676, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 2700 + }, + { + "entropy": 0.17544092936441302, + "epoch": 6.767123287671232, + "grad_norm": 0.5523537993431091, + "learning_rate": 6.483565488389582e-05, + "loss": 0.09709116220474243, + "mean_token_accuracy": 0.9650957375764847, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.27939334659035814, + "eval_loss": 0.7534670829772949, + "eval_mean_token_accuracy": 0.851230604010959, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.2913, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 2720 + }, + { + "entropy": 0.15991022661328316, + "epoch": 6.816936488169365, + "grad_norm": 0.478551983833313, + "learning_rate": 6.306626739450311e-05, + "loss": 0.09564646482467651, + "mean_token_accuracy": 0.9679084822535515, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.27878295491601146, + "eval_loss": 0.7519959211349487, + "eval_mean_token_accuracy": 0.8510654949864676, + "eval_num_tokens": 6397720.0, + "eval_runtime": 85.9109, + "eval_samples_per_second": 16.005, + "eval_steps_per_second": 2.002, + "step": 2740 + }, + { + "entropy": 0.16824879590421915, + "epoch": 6.866749688667497, + "grad_norm": 0.6681098937988281, + "learning_rate": 6.131198137800108e-05, + "loss": 0.0962279736995697, + "mean_token_accuracy": 0.966830012947321, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.2834690434121808, + "eval_loss": 0.751922070980072, + "eval_mean_token_accuracy": 0.8521237577809844, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.3618, + "eval_samples_per_second": 15.921, + "eval_steps_per_second": 1.992, + "step": 2760 + }, + { + "entropy": 0.1518704930320382, + "epoch": 6.916562889165629, + "grad_norm": 0.5201290249824524, + "learning_rate": 5.957332590312513e-05, + "loss": 0.09010660648345947, + "mean_token_accuracy": 0.9693463340401649, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.28485129617674404, + "eval_loss": 0.7452457547187805, + "eval_mean_token_accuracy": 0.8512036796919135, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.4524, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.99, + "step": 2780 + }, + { + "entropy": 0.15512610590085388, + "epoch": 6.966376089663761, + "grad_norm": 0.42802050709724426, + "learning_rate": 5.785082532465233e-05, + "loss": 0.09320432543754578, + "mean_token_accuracy": 0.9686134628951549, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.27554594526110693, + "eval_loss": 0.7644653916358948, + "eval_mean_token_accuracy": 0.8513738523389018, + "eval_num_tokens": 6540175.0, + "eval_runtime": 85.7609, + "eval_samples_per_second": 16.033, + "eval_steps_per_second": 2.006, + "step": 2800 + }, + { + "entropy": 0.17524497526196334, + "epoch": 7.01494396014944, + "grad_norm": 0.3330269157886505, + "learning_rate": 5.6144999125263545e-05, + "loss": 0.0895616888999939, + "mean_token_accuracy": 0.9682766932707566, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.2735865569218647, + "eval_loss": 0.768479585647583, + "eval_mean_token_accuracy": 0.8503459383581959, + "eval_num_tokens": 6583767.0, + "eval_runtime": 85.7162, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.007, + "step": 2820 + }, + { + "entropy": 0.1403565663844347, + "epoch": 7.064757160647572, + "grad_norm": 0.35613498091697693, + "learning_rate": 5.4456361758874235e-05, + "loss": 0.07551313638687134, + "mean_token_accuracy": 0.9739301167428493, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.25941789089593775, + "eval_loss": 0.8209511637687683, + "eval_mean_token_accuracy": 0.8505055855873019, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.0943, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 2840 + }, + { + "entropy": 0.13500106502324344, + "epoch": 7.114570361145703, + "grad_norm": 0.34418627619743347, + "learning_rate": 5.2785422495482234e-05, + "loss": 0.07293946146965027, + "mean_token_accuracy": 0.9747208289802074, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.26482899772912954, + "eval_loss": 0.798904538154602, + "eval_mean_token_accuracy": 0.8511530233677044, + "eval_num_tokens": 6672946.0, + "eval_runtime": 85.7915, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.005, + "step": 2860 + }, + { + "entropy": 0.13127502552233636, + "epoch": 7.164383561643835, + "grad_norm": 0.4638441503047943, + "learning_rate": 5.113268526757892e-05, + "loss": 0.07121461629867554, + "mean_token_accuracy": 0.9756786689162255, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2645381211714689, + "eval_loss": 0.809101939201355, + "eval_mean_token_accuracy": 0.8514727898115335, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.84, + "eval_samples_per_second": 16.018, + "eval_steps_per_second": 2.004, + "step": 2880 + }, + { + "entropy": 0.1331390908919275, + "epoch": 7.214196762141968, + "grad_norm": 0.40206775069236755, + "learning_rate": 4.949864851817007e-05, + "loss": 0.07188264131546021, + "mean_token_accuracy": 0.9755406074225903, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.26244733283339544, + "eval_loss": 0.8143188953399658, + "eval_mean_token_accuracy": 0.8514358189909957, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.8546, + "eval_samples_per_second": 16.015, + "eval_steps_per_second": 2.003, + "step": 2900 + }, + { + "entropy": 0.13647331558167936, + "epoch": 7.2640099626401, + "grad_norm": 0.26405787467956543, + "learning_rate": 4.788380505045224e-05, + "loss": 0.07412450313568116, + "mean_token_accuracy": 0.9744274213910102, + "num_tokens": 6809678.0, + "step": 2920 + }, + { + "epoch": 7.2640099626401, + "eval_entropy": 0.2626111418182074, + "eval_loss": 0.8111525177955627, + "eval_mean_token_accuracy": 0.8512121695418691, + "eval_num_tokens": 6809678.0, + "eval_runtime": 85.9626, + "eval_samples_per_second": 15.995, + "eval_steps_per_second": 2.001, + "step": 2920 + }, + { + "entropy": 0.12644002586603165, + "epoch": 7.313823163138232, + "grad_norm": 0.27514681220054626, + "learning_rate": 4.6288641879189884e-05, + "loss": 0.06807711124420165, + "mean_token_accuracy": 0.9760703906416893, + "num_tokens": 6860750.0, + "step": 2940 + }, + { + "epoch": 7.313823163138232, + "eval_entropy": 0.26096762734097106, + "eval_loss": 0.8184595108032227, + "eval_mean_token_accuracy": 0.8501476153384807, + "eval_num_tokens": 6860750.0, + "eval_runtime": 85.9521, + "eval_samples_per_second": 15.997, + "eval_steps_per_second": 2.001, + "step": 2940 + }, + { + "entropy": 0.13920630998909472, + "epoch": 7.363636363636363, + "grad_norm": 0.23584705591201782, + "learning_rate": 4.4713640083838604e-05, + "loss": 0.07301607131958007, + "mean_token_accuracy": 0.9745715200901032, + "num_tokens": 6907092.0, + "step": 2960 + }, + { + "epoch": 7.363636363636363, + "eval_entropy": 0.2612536767021168, + "eval_loss": 0.8116245269775391, + "eval_mean_token_accuracy": 0.8510967350976412, + "eval_num_tokens": 6907092.0, + "eval_runtime": 85.6373, + "eval_samples_per_second": 16.056, + "eval_steps_per_second": 2.008, + "step": 2960 + }, + { + "entropy": 0.1349492883309722, + "epoch": 7.4134495641344955, + "grad_norm": 0.24552719295024872, + "learning_rate": 4.315927466345791e-05, + "loss": 0.07397544980049134, + "mean_token_accuracy": 0.9745095103979111, + "num_tokens": 6952700.0, + "step": 2980 + }, + { + "epoch": 7.4134495641344955, + "eval_entropy": 0.25796533306670744, + "eval_loss": 0.8266491293907166, + "eval_mean_token_accuracy": 0.8511653857868772, + "eval_num_tokens": 6952700.0, + "eval_runtime": 85.7462, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.006, + "step": 2980 + }, + { + "entropy": 0.14479175000451505, + "epoch": 7.463262764632628, + "grad_norm": 0.2846072018146515, + "learning_rate": 4.162601439345814e-05, + "loss": 0.07544798254966736, + "mean_token_accuracy": 0.9727819666266442, + "num_tokens": 6996430.0, + "step": 3000 + }, + { + "epoch": 7.463262764632628, + "eval_entropy": 0.2584348309698493, + "eval_loss": 0.8253348469734192, + "eval_mean_token_accuracy": 0.8511569815319638, + "eval_num_tokens": 6996430.0, + "eval_runtime": 86.2984, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 3000 + }, + { + "entropy": 0.14114196319133043, + "epoch": 7.51307596513076, + "grad_norm": 0.407966285943985, + "learning_rate": 4.011432168422419e-05, + "loss": 0.0736398994922638, + "mean_token_accuracy": 0.9741654269397259, + "num_tokens": 7042038.0, + "step": 3020 + }, + { + "epoch": 7.51307596513076, + "eval_entropy": 0.25232676260693127, + "eval_loss": 0.8296052813529968, + "eval_mean_token_accuracy": 0.8523298349491385, + "eval_num_tokens": 7042038.0, + "eval_runtime": 85.8445, + "eval_samples_per_second": 16.017, + "eval_steps_per_second": 2.004, + "step": 3020 + }, + { + "entropy": 0.1353456223383546, + "epoch": 7.562889165628892, + "grad_norm": 0.2712634801864624, + "learning_rate": 3.8624652441658684e-05, + "loss": 0.07362412214279175, + "mean_token_accuracy": 0.9747945807874203, + "num_tokens": 7089390.0, + "step": 3040 + }, + { + "epoch": 7.562889165628892, + "eval_entropy": 0.2579477243991785, + "eval_loss": 0.8274564743041992, + "eval_mean_token_accuracy": 0.8517705212498821, + "eval_num_tokens": 7089390.0, + "eval_runtime": 85.8222, + "eval_samples_per_second": 16.022, + "eval_steps_per_second": 2.004, + "step": 3040 + }, + { + "entropy": 0.1296080862637609, + "epoch": 7.6127023661270234, + "grad_norm": 0.2371893972158432, + "learning_rate": 3.715745592968707e-05, + "loss": 0.06971035599708557, + "mean_token_accuracy": 0.9759043246507645, + "num_tokens": 7138002.0, + "step": 3060 + }, + { + "epoch": 7.6127023661270234, + "eval_entropy": 0.25391967083479083, + "eval_loss": 0.8197130560874939, + "eval_mean_token_accuracy": 0.8522267875283264, + "eval_num_tokens": 7138002.0, + "eval_runtime": 85.8796, + "eval_samples_per_second": 16.011, + "eval_steps_per_second": 2.003, + "step": 3060 + }, + { + "entropy": 0.1311203008517623, + "epoch": 7.662515566625156, + "grad_norm": 0.22499267756938934, + "learning_rate": 3.5713174634765967e-05, + "loss": 0.07176244258880615, + "mean_token_accuracy": 0.9754939571022987, + "num_tokens": 7185520.0, + "step": 3080 + }, + { + "epoch": 7.662515566625156, + "eval_entropy": 0.2526215241225653, + "eval_loss": 0.8265154361724854, + "eval_mean_token_accuracy": 0.8519952584837758, + "eval_num_tokens": 7185520.0, + "eval_runtime": 85.8746, + "eval_samples_per_second": 16.012, + "eval_steps_per_second": 2.003, + "step": 3080 + }, + { + "entropy": 0.13420484317466616, + "epoch": 7.712328767123288, + "grad_norm": 0.2398064285516739, + "learning_rate": 3.4292244132434866e-05, + "loss": 0.07559212446212768, + "mean_token_accuracy": 0.9743142127990723, + "num_tokens": 7232170.0, + "step": 3100 + }, + { + "epoch": 7.712328767123288, + "eval_entropy": 0.2484562756537005, + "eval_loss": 0.8312150239944458, + "eval_mean_token_accuracy": 0.8528405119513356, + "eval_num_tokens": 7232170.0, + "eval_runtime": 85.7896, + "eval_samples_per_second": 16.028, + "eval_steps_per_second": 2.005, + "step": 3100 + }, + { + "entropy": 0.11965563679113984, + "epoch": 7.76214196762142, + "grad_norm": 0.3408384919166565, + "learning_rate": 3.2895092955952746e-05, + "loss": 0.0661750853061676, + "mean_token_accuracy": 0.9776600524783134, + "num_tokens": 7282846.0, + "step": 3120 + }, + { + "epoch": 7.76214196762142, + "eval_entropy": 0.2522421533804993, + "eval_loss": 0.8327009677886963, + "eval_mean_token_accuracy": 0.8524222023958383, + "eval_num_tokens": 7282846.0, + "eval_runtime": 86.1769, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 1.996, + "step": 3120 + }, + { + "entropy": 0.13388084415346385, + "epoch": 7.811955168119551, + "grad_norm": 0.35418516397476196, + "learning_rate": 3.152214246705829e-05, + "loss": 0.07149899601936341, + "mean_token_accuracy": 0.9747635535895824, + "num_tokens": 7331518.0, + "step": 3140 + }, + { + "epoch": 7.811955168119551, + "eval_entropy": 0.25038352296795957, + "eval_loss": 0.836457371711731, + "eval_mean_token_accuracy": 0.8526130665180295, + "eval_num_tokens": 7331518.0, + "eval_runtime": 85.6099, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.009, + "step": 3140 + }, + { + "entropy": 0.13530643959529698, + "epoch": 7.861768368617684, + "grad_norm": 0.38060539960861206, + "learning_rate": 3.017380672889291e-05, + "loss": 0.07116585969924927, + "mean_token_accuracy": 0.973284512758255, + "num_tokens": 7379056.0, + "step": 3160 + }, + { + "epoch": 7.861768368617684, + "eval_entropy": 0.255092611319797, + "eval_loss": 0.8314701914787292, + "eval_mean_token_accuracy": 0.8520913099826768, + "eval_num_tokens": 7379056.0, + "eval_runtime": 85.877, + "eval_samples_per_second": 16.011, + "eval_steps_per_second": 2.003, + "step": 3160 + }, + { + "entropy": 0.13383390177041293, + "epoch": 7.911581569115816, + "grad_norm": 0.3827536106109619, + "learning_rate": 2.8850492381124808e-05, + "loss": 0.07305437326431274, + "mean_token_accuracy": 0.9750778004527092, + "num_tokens": 7424770.0, + "step": 3180 + }, + { + "epoch": 7.911581569115816, + "eval_entropy": 0.25416371157003004, + "eval_loss": 0.8206402063369751, + "eval_mean_token_accuracy": 0.852779901651449, + "eval_num_tokens": 7424770.0, + "eval_runtime": 86.1015, + "eval_samples_per_second": 15.97, + "eval_steps_per_second": 1.998, + "step": 3180 + }, + { + "entropy": 0.1395680439658463, + "epoch": 7.961394769613948, + "grad_norm": 0.3809775412082672, + "learning_rate": 2.7552598517312256e-05, + "loss": 0.07236042022705078, + "mean_token_accuracy": 0.9731538116931915, + "num_tokens": 7470804.0, + "step": 3200 + }, + { + "epoch": 7.961394769613948, + "eval_entropy": 0.25528111975899964, + "eval_loss": 0.8230037093162537, + "eval_mean_token_accuracy": 0.8526452603035195, + "eval_num_tokens": 7470804.0, + "eval_runtime": 85.7895, + "eval_samples_per_second": 16.028, + "eval_steps_per_second": 2.005, + "step": 3200 + }, + { + "entropy": 0.12193699864049752, + "epoch": 8.009962640099626, + "grad_norm": 0.11854425817728043, + "learning_rate": 2.6280516564542205e-05, + "loss": 0.06617764234542847, + "mean_token_accuracy": 0.977179691577569, + "num_tokens": 7518110.0, + "step": 3220 + }, + { + "epoch": 8.009962640099626, + "eval_entropy": 0.25100527677771656, + "eval_loss": 0.8393343687057495, + "eval_mean_token_accuracy": 0.8522553132023922, + "eval_num_tokens": 7518110.0, + "eval_runtime": 85.8837, + "eval_samples_per_second": 16.01, + "eval_steps_per_second": 2.003, + "step": 3220 + }, + { + "entropy": 0.12788885813206435, + "epoch": 8.059775840597759, + "grad_norm": 0.16094881296157837, + "learning_rate": 2.50346301653812e-05, + "loss": 0.06274186968803405, + "mean_token_accuracy": 0.9766994707286358, + "num_tokens": 7565539.0, + "step": 3240 + }, + { + "epoch": 8.059775840597759, + "eval_entropy": 0.24409458682287571, + "eval_loss": 0.874617338180542, + "eval_mean_token_accuracy": 0.8521041180505309, + "eval_num_tokens": 7565539.0, + "eval_runtime": 86.2656, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 3240 + }, + { + "entropy": 0.12464155335910618, + "epoch": 8.10958904109589, + "grad_norm": 0.16893954575061798, + "learning_rate": 2.381531506217437e-05, + "loss": 0.06093020439147949, + "mean_token_accuracy": 0.9776258453726768, + "num_tokens": 7612578.0, + "step": 3260 + }, + { + "epoch": 8.10958904109589, + "eval_entropy": 0.24396493017326953, + "eval_loss": 0.891161322593689, + "eval_mean_token_accuracy": 0.8515338024427724, + "eval_num_tokens": 7612578.0, + "eval_runtime": 85.9061, + "eval_samples_per_second": 16.006, + "eval_steps_per_second": 2.002, + "step": 3260 + }, + { + "entropy": 0.12345920228399336, + "epoch": 8.159402241594023, + "grad_norm": 0.14332273602485657, + "learning_rate": 2.262293898372616e-05, + "loss": 0.061289966106414795, + "mean_token_accuracy": 0.9762230902910233, + "num_tokens": 7660157.0, + "step": 3280 + }, + { + "epoch": 8.159402241594023, + "eval_entropy": 0.2481445314059424, + "eval_loss": 0.8922848105430603, + "eval_mean_token_accuracy": 0.8514944855556932, + "eval_num_tokens": 7660157.0, + "eval_runtime": 85.5201, + "eval_samples_per_second": 16.078, + "eval_steps_per_second": 2.011, + "step": 3280 + }, + { + "entropy": 0.12298110066913068, + "epoch": 8.209215442092155, + "grad_norm": 0.21848882734775543, + "learning_rate": 2.1457861534398633e-05, + "loss": 0.05986443758010864, + "mean_token_accuracy": 0.9786281704902648, + "num_tokens": 7709745.0, + "step": 3300 + }, + { + "epoch": 8.209215442092155, + "eval_entropy": 0.24329388124305149, + "eval_loss": 0.9021085500717163, + "eval_mean_token_accuracy": 0.8521762625422589, + "eval_num_tokens": 7709745.0, + "eval_runtime": 85.955, + "eval_samples_per_second": 15.997, + "eval_steps_per_second": 2.001, + "step": 3300 + }, + { + "entropy": 0.13265180448070168, + "epoch": 8.259028642590286, + "grad_norm": 0.18067947030067444, + "learning_rate": 2.0320434085659692e-05, + "loss": 0.06724961400032044, + "mean_token_accuracy": 0.975098168104887, + "num_tokens": 7753571.0, + "step": 3320 + }, + { + "epoch": 8.259028642590286, + "eval_entropy": 0.2433211464694766, + "eval_loss": 0.9094350337982178, + "eval_mean_token_accuracy": 0.8520150094531304, + "eval_num_tokens": 7753571.0, + "eval_runtime": 85.7989, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.005, + "step": 3320 + }, + { + "entropy": 0.11949320202693343, + "epoch": 8.308841843088418, + "grad_norm": 0.17020289599895477, + "learning_rate": 1.9210999670114196e-05, + "loss": 0.0634455680847168, + "mean_token_accuracy": 0.9771294385194779, + "num_tokens": 7799310.0, + "step": 3340 + }, + { + "epoch": 8.308841843088418, + "eval_entropy": 0.24345201219237128, + "eval_loss": 0.9021793603897095, + "eval_mean_token_accuracy": 0.8520745697409607, + "eval_num_tokens": 7799310.0, + "eval_runtime": 86.0883, + "eval_samples_per_second": 15.972, + "eval_steps_per_second": 1.998, + "step": 3340 + }, + { + "entropy": 0.12065747743472457, + "epoch": 8.35865504358655, + "grad_norm": 0.16789060831069946, + "learning_rate": 1.8129892878049886e-05, + "loss": 0.061494195461273195, + "mean_token_accuracy": 0.9779584899544715, + "num_tokens": 7846447.0, + "step": 3360 + }, + { + "epoch": 8.35865504358655, + "eval_entropy": 0.24093415042342142, + "eval_loss": 0.9006755352020264, + "eval_mean_token_accuracy": 0.852174230786257, + "eval_num_tokens": 7846447.0, + "eval_runtime": 85.9011, + "eval_samples_per_second": 16.007, + "eval_steps_per_second": 2.002, + "step": 3360 + }, + { + "entropy": 0.13125578537583352, + "epoch": 8.408468244084682, + "grad_norm": 0.1662452220916748, + "learning_rate": 1.70774397565298e-05, + "loss": 0.06685600876808166, + "mean_token_accuracy": 0.9744067586958408, + "num_tokens": 7890283.0, + "step": 3380 + }, + { + "epoch": 8.408468244084682, + "eval_entropy": 0.24062153688350388, + "eval_loss": 0.9078915119171143, + "eval_mean_token_accuracy": 0.8523201647886011, + "eval_num_tokens": 7890283.0, + "eval_runtime": 86.0201, + "eval_samples_per_second": 15.985, + "eval_steps_per_second": 2.0, + "step": 3380 + }, + { + "entropy": 0.11986117120832204, + "epoch": 8.458281444582815, + "grad_norm": 0.19571948051452637, + "learning_rate": 1.6053957711060606e-05, + "loss": 0.06411095261573792, + "mean_token_accuracy": 0.9770627245306969, + "num_tokens": 7936518.0, + "step": 3400 + }, + { + "epoch": 8.458281444582815, + "eval_entropy": 0.24352820347561394, + "eval_loss": 0.9058943390846252, + "eval_mean_token_accuracy": 0.8519382792156797, + "eval_num_tokens": 7936518.0, + "eval_runtime": 85.966, + "eval_samples_per_second": 15.995, + "eval_steps_per_second": 2.001, + "step": 3400 + }, + { + "entropy": 0.12857897616922856, + "epoch": 8.508094645080947, + "grad_norm": 0.2609264850616455, + "learning_rate": 1.5059755409867613e-05, + "loss": 0.06473397612571716, + "mean_token_accuracy": 0.9764650195837021, + "num_tokens": 7981966.0, + "step": 3420 + }, + { + "epoch": 8.508094645080947, + "eval_entropy": 0.24032609000108962, + "eval_loss": 0.9077776074409485, + "eval_mean_token_accuracy": 0.8517829197090726, + "eval_num_tokens": 7981966.0, + "eval_runtime": 86.6059, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 3420 + }, + { + "entropy": 0.12348870886489749, + "epoch": 8.557907845579079, + "grad_norm": 0.19537609815597534, + "learning_rate": 1.409513269080473e-05, + "loss": 0.06481348872184753, + "mean_token_accuracy": 0.9769559659063816, + "num_tokens": 8028367.0, + "step": 3440 + }, + { + "epoch": 8.557907845579079, + "eval_entropy": 0.2404322574824788, + "eval_loss": 0.9057720899581909, + "eval_mean_token_accuracy": 0.8521037981953732, + "eval_num_tokens": 8028367.0, + "eval_runtime": 86.166, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.996, + "step": 3440 + }, + { + "entropy": 0.12040232736617326, + "epoch": 8.607721046077211, + "grad_norm": 0.3310582935810089, + "learning_rate": 1.3160380470927183e-05, + "loss": 0.06468871235847473, + "mean_token_accuracy": 0.9768650442361831, + "num_tokens": 8074934.0, + "step": 3460 + }, + { + "epoch": 8.607721046077211, + "eval_entropy": 0.24118655876711356, + "eval_loss": 0.9028318524360657, + "eval_mean_token_accuracy": 0.8521025340224422, + "eval_num_tokens": 8074934.0, + "eval_runtime": 85.3668, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.015, + "step": 3460 + }, + { + "entropy": 0.12328103906475008, + "epoch": 8.657534246575342, + "grad_norm": 0.12836167216300964, + "learning_rate": 1.2255780658755122e-05, + "loss": 0.06229386329650879, + "mean_token_accuracy": 0.9763277888298034, + "num_tokens": 8122775.0, + "step": 3480 + }, + { + "epoch": 8.657534246575342, + "eval_entropy": 0.24194598145956217, + "eval_loss": 0.9009329080581665, + "eval_mean_token_accuracy": 0.8521693289973015, + "eval_num_tokens": 8122775.0, + "eval_runtime": 85.9415, + "eval_samples_per_second": 15.999, + "eval_steps_per_second": 2.001, + "step": 3480 + }, + { + "entropy": 0.11321646976284683, + "epoch": 8.707347447073474, + "grad_norm": 0.15656894445419312, + "learning_rate": 1.1381606069253786e-05, + "loss": 0.05908188819885254, + "mean_token_accuracy": 0.9779504477977753, + "num_tokens": 8174307.0, + "step": 3500 + }, + { + "epoch": 8.707347447073474, + "eval_entropy": 0.24121542517528977, + "eval_loss": 0.9016091823577881, + "eval_mean_token_accuracy": 0.8521790667328724, + "eval_num_tokens": 8174307.0, + "eval_runtime": 85.7465, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.006, + "step": 3500 + }, + { + "entropy": 0.12657046681270004, + "epoch": 8.757160647571606, + "grad_norm": 0.22597502171993256, + "learning_rate": 1.053812034155629e-05, + "loss": 0.06244581937789917, + "mean_token_accuracy": 0.976795207709074, + "num_tokens": 8222808.0, + "step": 3520 + }, + { + "epoch": 8.757160647571606, + "eval_entropy": 0.23877542708502258, + "eval_loss": 0.9069110155105591, + "eval_mean_token_accuracy": 0.8522880177858264, + "eval_num_tokens": 8222808.0, + "eval_runtime": 85.7792, + "eval_samples_per_second": 16.03, + "eval_steps_per_second": 2.005, + "step": 3520 + }, + { + "entropy": 0.11422101808711886, + "epoch": 8.806973848069738, + "grad_norm": 0.21139323711395264, + "learning_rate": 9.725577859453502e-06, + "loss": 0.05988085865974426, + "mean_token_accuracy": 0.9779510758817196, + "num_tokens": 8273335.0, + "step": 3540 + }, + { + "epoch": 8.806973848069738, + "eval_entropy": 0.2393161087881687, + "eval_loss": 0.9033801555633545, + "eval_mean_token_accuracy": 0.8522614209457885, + "eval_num_tokens": 8273335.0, + "eval_runtime": 85.5594, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 3540 + }, + { + "entropy": 0.13810604228638113, + "epoch": 8.85678704856787, + "grad_norm": 0.24571993947029114, + "learning_rate": 8.944223674675537e-06, + "loss": 0.07036117911338806, + "mean_token_accuracy": 0.9734892748296261, + "num_tokens": 8315235.0, + "step": 3560 + }, + { + "epoch": 8.85678704856787, + "eval_entropy": 0.23998506947658782, + "eval_loss": 0.9009848833084106, + "eval_mean_token_accuracy": 0.8521793619837872, + "eval_num_tokens": 8315235.0, + "eval_runtime": 86.0974, + "eval_samples_per_second": 15.97, + "eval_steps_per_second": 1.998, + "step": 3560 + }, + { + "entropy": 0.14193559321574867, + "epoch": 8.906600249066003, + "grad_norm": 0.17304112017154694, + "learning_rate": 8.194293432987386e-06, + "loss": 0.07077967524528503, + "mean_token_accuracy": 0.973305893689394, + "num_tokens": 8358099.0, + "step": 3580 + }, + { + "epoch": 8.906600249066003, + "eval_entropy": 0.23883876689644748, + "eval_loss": 0.9015622138977051, + "eval_mean_token_accuracy": 0.8524864378363587, + "eval_num_tokens": 8358099.0, + "eval_runtime": 86.0089, + "eval_samples_per_second": 15.987, + "eval_steps_per_second": 2.0, + "step": 3580 + }, + { + "entropy": 0.11878943420015275, + "epoch": 8.956413449564135, + "grad_norm": 0.19075658917427063, + "learning_rate": 7.476013303121426e-06, + "loss": 0.060806107521057126, + "mean_token_accuracy": 0.9776863709092141, + "num_tokens": 8407430.0, + "step": 3600 + }, + { + "epoch": 8.956413449564135, + "eval_entropy": 0.23726526309931, + "eval_loss": 0.9060276746749878, + "eval_mean_token_accuracy": 0.8524192058762838, + "eval_num_tokens": 8407430.0, + "eval_runtime": 85.7252, + "eval_samples_per_second": 16.04, + "eval_steps_per_second": 2.006, + "step": 3600 + }, + { + "entropy": 0.1255835090787747, + "epoch": 9.004981320049813, + "grad_norm": 0.11608047038316727, + "learning_rate": 6.78959990856799e-06, + "loss": 0.06319612860679627, + "mean_token_accuracy": 0.9766685519462976, + "num_tokens": 8453175.0, + "step": 3620 + }, + { + "epoch": 9.004981320049813, + "eval_entropy": 0.2373251837006835, + "eval_loss": 0.9045722484588623, + "eval_mean_token_accuracy": 0.8525558363559634, + "eval_num_tokens": 8453175.0, + "eval_runtime": 85.7435, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.006, + "step": 3620 + }, + { + "entropy": 0.12587778437882663, + "epoch": 9.054794520547945, + "grad_norm": 0.1564614623785019, + "learning_rate": 6.135260262244683e-06, + "loss": 0.0630365788936615, + "mean_token_accuracy": 0.9777486085891723, + "num_tokens": 8497151.0, + "step": 3640 + }, + { + "epoch": 9.054794520547945, + "eval_entropy": 0.23559923721260803, + "eval_loss": 0.9120694398880005, + "eval_mean_token_accuracy": 0.8525292966947999, + "eval_num_tokens": 8497151.0, + "eval_runtime": 85.8018, + "eval_samples_per_second": 16.025, + "eval_steps_per_second": 2.005, + "step": 3640 + }, + { + "entropy": 0.12535365503281354, + "epoch": 9.104607721046078, + "grad_norm": 0.1404249221086502, + "learning_rate": 5.513191704064086e-06, + "loss": 0.060502654314041136, + "mean_token_accuracy": 0.9770058333873749, + "num_tokens": 8542996.0, + "step": 3660 + }, + { + "epoch": 9.104607721046078, + "eval_entropy": 0.23525122691725575, + "eval_loss": 0.9182237982749939, + "eval_mean_token_accuracy": 0.8524098333924316, + "eval_num_tokens": 8542996.0, + "eval_runtime": 85.9872, + "eval_samples_per_second": 15.991, + "eval_steps_per_second": 2.0, + "step": 3660 + }, + { + "entropy": 0.11330419047735632, + "epoch": 9.15442092154421, + "grad_norm": 0.15513843297958374, + "learning_rate": 4.92358184141876e-06, + "loss": 0.05822383761405945, + "mean_token_accuracy": 0.9793384782969952, + "num_tokens": 8591625.0, + "step": 3680 + }, + { + "epoch": 9.15442092154421, + "eval_entropy": 0.2353947116711805, + "eval_loss": 0.9229223132133484, + "eval_mean_token_accuracy": 0.852500357253607, + "eval_num_tokens": 8591625.0, + "eval_runtime": 86.0805, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.998, + "step": 3680 + }, + { + "entropy": 0.11830627010203898, + "epoch": 9.204234122042342, + "grad_norm": 0.1730550080537796, + "learning_rate": 4.366608492601456e-06, + "loss": 0.05860854983329773, + "mean_token_accuracy": 0.9779663667082786, + "num_tokens": 8639845.0, + "step": 3700 + }, + { + "epoch": 9.204234122042342, + "eval_entropy": 0.23567205719476522, + "eval_loss": 0.9269373416900635, + "eval_mean_token_accuracy": 0.8523658004611038, + "eval_num_tokens": 8639845.0, + "eval_runtime": 85.9809, + "eval_samples_per_second": 15.992, + "eval_steps_per_second": 2.0, + "step": 3700 + }, + { + "entropy": 0.1180900705512613, + "epoch": 9.254047322540472, + "grad_norm": 0.20909737050533295, + "learning_rate": 3.842439633177387e-06, + "loss": 0.059438884258270264, + "mean_token_accuracy": 0.9786856278777123, + "num_tokens": 8687194.0, + "step": 3720 + }, + { + "epoch": 9.254047322540472, + "eval_entropy": 0.23602714493524196, + "eval_loss": 0.9293538928031921, + "eval_mean_token_accuracy": 0.8523273440294488, + "eval_num_tokens": 8687194.0, + "eval_runtime": 85.2118, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.019, + "step": 3720 + }, + { + "entropy": 0.13156692241318524, + "epoch": 9.303860523038605, + "grad_norm": 0.12535709142684937, + "learning_rate": 3.3512333453253305e-06, + "loss": 0.06337688565254211, + "mean_token_accuracy": 0.9756712593138218, + "num_tokens": 8731721.0, + "step": 3740 + }, + { + "epoch": 9.303860523038605, + "eval_entropy": 0.23534389351343, + "eval_loss": 0.932999312877655, + "eval_mean_token_accuracy": 0.8523333925147389, + "eval_num_tokens": 8731721.0, + "eval_runtime": 85.953, + "eval_samples_per_second": 15.997, + "eval_steps_per_second": 2.001, + "step": 3740 + }, + { + "entropy": 0.12327516414225101, + "epoch": 9.353673723536737, + "grad_norm": 0.16341575980186462, + "learning_rate": 2.8931377701619306e-06, + "loss": 0.05869622826576233, + "mean_token_accuracy": 0.9784224212169648, + "num_tokens": 8778614.0, + "step": 3760 + }, + { + "epoch": 9.353673723536737, + "eval_entropy": 0.23493653622477553, + "eval_loss": 0.9358566999435425, + "eval_mean_token_accuracy": 0.8522722783476807, + "eval_num_tokens": 8778614.0, + "eval_runtime": 85.2538, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.018, + "step": 3760 + }, + { + "entropy": 0.1134357453789562, + "epoch": 9.403486924034869, + "grad_norm": 0.23999616503715515, + "learning_rate": 2.4682910630645723e-06, + "loss": 0.057540220022201535, + "mean_token_accuracy": 0.9798057802021504, + "num_tokens": 8826551.0, + "step": 3780 + }, + { + "epoch": 9.403486924034869, + "eval_entropy": 0.23470525634150172, + "eval_loss": 0.937556266784668, + "eval_mean_token_accuracy": 0.8523351706044618, + "eval_num_tokens": 8826551.0, + "eval_runtime": 85.7764, + "eval_samples_per_second": 16.03, + "eval_steps_per_second": 2.005, + "step": 3780 + }, + { + "entropy": 0.1075570048764348, + "epoch": 9.453300124533001, + "grad_norm": 0.15417765080928802, + "learning_rate": 2.0768213520055406e-06, + "loss": 0.05581026673316956, + "mean_token_accuracy": 0.9797527104616165, + "num_tokens": 8876556.0, + "step": 3800 + }, + { + "epoch": 9.453300124533001, + "eval_entropy": 0.2347462713545145, + "eval_loss": 0.9383137226104736, + "eval_mean_token_accuracy": 0.8522575324357942, + "eval_num_tokens": 8876556.0, + "eval_runtime": 85.8985, + "eval_samples_per_second": 16.007, + "eval_steps_per_second": 2.002, + "step": 3800 + }, + { + "entropy": 0.12609313456341625, + "epoch": 9.503113325031133, + "grad_norm": 0.22041426599025726, + "learning_rate": 1.7188466989102739e-06, + "loss": 0.06379218697547913, + "mean_token_accuracy": 0.9763593293726445, + "num_tokens": 8920286.0, + "step": 3820 + }, + { + "epoch": 9.503113325031133, + "eval_entropy": 0.23459658849724505, + "eval_loss": 0.9393337965011597, + "eval_mean_token_accuracy": 0.8523633532052817, + "eval_num_tokens": 8920286.0, + "eval_runtime": 85.9348, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.002, + "step": 3820 + }, + { + "entropy": 0.12149709439836442, + "epoch": 9.552926525529266, + "grad_norm": 0.16608643531799316, + "learning_rate": 1.3944750640516357e-06, + "loss": 0.06341606974601746, + "mean_token_accuracy": 0.9771503552794456, + "num_tokens": 8964464.0, + "step": 3840 + }, + { + "epoch": 9.552926525529266, + "eval_entropy": 0.2347291322468325, + "eval_loss": 0.9399036765098572, + "eval_mean_token_accuracy": 0.8523768914300341, + "eval_num_tokens": 8964464.0, + "eval_runtime": 86.1305, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.997, + "step": 3840 + }, + { + "entropy": 0.11724846777506173, + "epoch": 9.602739726027398, + "grad_norm": 0.13613300025463104, + "learning_rate": 1.103804273490497e-06, + "loss": 0.05994418263435364, + "mean_token_accuracy": 0.9778759330511093, + "num_tokens": 9010414.0, + "step": 3860 + }, + { + "epoch": 9.602739726027398, + "eval_entropy": 0.23495923337894817, + "eval_loss": 0.9400841593742371, + "eval_mean_token_accuracy": 0.8523780471363733, + "eval_num_tokens": 9010414.0, + "eval_runtime": 86.0379, + "eval_samples_per_second": 15.981, + "eval_steps_per_second": 1.999, + "step": 3860 + }, + { + "entropy": 0.12054574331268668, + "epoch": 9.65255292652553, + "grad_norm": 0.11884245276451111, + "learning_rate": 8.469219895727582e-07, + "loss": 0.05917409062385559, + "mean_token_accuracy": 0.9771256923675538, + "num_tokens": 9058053.0, + "step": 3880 + }, + { + "epoch": 9.65255292652553, + "eval_entropy": 0.23499552723626757, + "eval_loss": 0.9404177665710449, + "eval_mean_token_accuracy": 0.8523571678372317, + "eval_num_tokens": 9058053.0, + "eval_runtime": 86.0174, + "eval_samples_per_second": 15.985, + "eval_steps_per_second": 2.0, + "step": 3880 + }, + { + "entropy": 0.12163264504633844, + "epoch": 9.70236612702366, + "grad_norm": 0.18393972516059875, + "learning_rate": 6.239056844915407e-07, + "loss": 0.059613007307052615, + "mean_token_accuracy": 0.9776720523834228, + "num_tokens": 9105574.0, + "step": 3900 + }, + { + "epoch": 9.70236612702366, + "eval_entropy": 0.23491846319547918, + "eval_loss": 0.9405836462974548, + "eval_mean_token_accuracy": 0.8523543633000795, + "eval_num_tokens": 9105574.0, + "eval_runtime": 85.9519, + "eval_samples_per_second": 15.997, + "eval_steps_per_second": 2.001, + "step": 3900 + }, + { + "entropy": 0.11569633753970265, + "epoch": 9.752179327521793, + "grad_norm": 0.1553788185119629, + "learning_rate": 4.3482261692267186e-07, + "loss": 0.05866732001304627, + "mean_token_accuracy": 0.9790047742426395, + "num_tokens": 9152793.0, + "step": 3920 + }, + { + "epoch": 9.752179327521793, + "eval_entropy": 0.23489533165513082, + "eval_loss": 0.9410145878791809, + "eval_mean_token_accuracy": 0.8524025068726651, + "eval_num_tokens": 9152793.0, + "eval_runtime": 85.5221, + "eval_samples_per_second": 16.078, + "eval_steps_per_second": 2.011, + "step": 3920 + }, + { + "entropy": 0.12030278495512903, + "epoch": 9.801992528019925, + "grad_norm": 0.20454250276088715, + "learning_rate": 2.797298117403634e-07, + "loss": 0.061210107803344724, + "mean_token_accuracy": 0.9774218738079071, + "num_tokens": 9199382.0, + "step": 3940 + }, + { + "epoch": 9.801992528019925, + "eval_entropy": 0.2348609700105911, + "eval_loss": 0.9410302639007568, + "eval_mean_token_accuracy": 0.8523409498292346, + "eval_num_tokens": 9199382.0, + "eval_runtime": 85.9105, + "eval_samples_per_second": 16.005, + "eval_steps_per_second": 2.002, + "step": 3940 + }, + { + "entropy": 0.11162231937050819, + "epoch": 9.851805728518057, + "grad_norm": 0.13079790771007538, + "learning_rate": 1.5867404281932237e-07, + "loss": 0.05349419116973877, + "mean_token_accuracy": 0.9791230395436287, + "num_tokens": 9251912.0, + "step": 3960 + }, + { + "epoch": 9.851805728518057, + "eval_entropy": 0.23484029950097549, + "eval_loss": 0.9411523342132568, + "eval_mean_token_accuracy": 0.8523351938225502, + "eval_num_tokens": 9251912.0, + "eval_runtime": 85.1298, + "eval_samples_per_second": 16.152, + "eval_steps_per_second": 2.02, + "step": 3960 + }, + { + "entropy": 0.12446248792111873, + "epoch": 9.90161892901619, + "grad_norm": 0.1705058217048645, + "learning_rate": 7.16918189283218e-08, + "loss": 0.061916273832321164, + "mean_token_accuracy": 0.9767685994505882, + "num_tokens": 9296482.0, + "step": 3980 + }, + { + "epoch": 9.90161892901619, + "eval_entropy": 0.2347967088395773, + "eval_loss": 0.9411665201187134, + "eval_mean_token_accuracy": 0.8524297087691551, + "eval_num_tokens": 9296482.0, + "eval_runtime": 86.2026, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 3980 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.9249780299562394e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-40/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-40/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-40/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-40/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-40/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-40/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-40/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-40/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-40/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-40/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-40/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-40/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-40/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-40/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..510e50b0318f41db38c10ff49f55f9e68cd3840a --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-40/trainer_state.json @@ -0,0 +1,76 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 0.099626400996264, + "eval_steps": 20, + "global_step": 40, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3753325286326272.0, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-400/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-400/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-400/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-400/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-400/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-400/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-400/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-400/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-400/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-400/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-400/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-400/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-400/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-400/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..bb904f47ee935149ff36d61610b34fafa92bc622 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-400/trainer_state.json @@ -0,0 +1,454 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 0.9962640099626401, + "eval_steps": 20, + "global_step": 400, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.964974918647808e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4000/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4000/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4000/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4000/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4000/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4000/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4000/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4000/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4000/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4000/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4000/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4000/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4000/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4000/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..ed0f3f1e65e0b73f457ca3f838d5667ca4a77ba0 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4000/trainer_state.json @@ -0,0 +1,4234 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 9.951432129514322, + "eval_steps": 20, + "global_step": 4000, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + }, + { + "entropy": 0.561330484598875, + "epoch": 1.891656288916563, + "grad_norm": 0.6722865700721741, + "learning_rate": 0.0002208867897174789, + "loss": 0.499837589263916, + "mean_token_accuracy": 0.8518734864890576, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.5865232653396074, + "eval_loss": 0.5437926650047302, + "eval_mean_token_accuracy": 0.8450997017843779, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4116, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.547389242425561, + "epoch": 1.9414694894146949, + "grad_norm": 0.7935577034950256, + "learning_rate": 0.00022027119820226907, + "loss": 0.4977591514587402, + "mean_token_accuracy": 0.8539491161704064, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.5290903090391048, + "eval_loss": 0.5409526824951172, + "eval_mean_token_accuracy": 0.8497545698354411, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.7262, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 780 + }, + { + "entropy": 0.5687909748405218, + "epoch": 1.9912826899128269, + "grad_norm": 0.6180546283721924, + "learning_rate": 0.00021962329729698345, + "loss": 0.5109643459320068, + "mean_token_accuracy": 0.8521598495543004, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.5503541858390321, + "eval_loss": 0.5361555218696594, + "eval_mean_token_accuracy": 0.8510884285666221, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.3339, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 800 + }, + { + "entropy": 0.4739728841261986, + "epoch": 2.0398505603985058, + "grad_norm": 0.8058829307556152, + "learning_rate": 0.0002189432823996982, + "loss": 0.4204097747802734, + "mean_token_accuracy": 0.8728981889211215, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.5077334992414297, + "eval_loss": 0.5531114339828491, + "eval_mean_token_accuracy": 0.8489257208136625, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.4801, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.989, + "step": 820 + }, + { + "entropy": 0.4594309840351343, + "epoch": 2.0896637608966375, + "grad_norm": 0.6906896829605103, + "learning_rate": 0.0002182313585936314, + "loss": 0.4071959495544434, + "mean_token_accuracy": 0.8732857562601566, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.49850136994622474, + "eval_loss": 0.5486204624176025, + "eval_mean_token_accuracy": 0.8507991450470548, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.3364, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.4881629109382629, + "epoch": 2.1394769613947697, + "grad_norm": 0.6343470215797424, + "learning_rate": 0.0002174877405852928, + "loss": 0.41669540405273436, + "mean_token_accuracy": 0.8711295068264008, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.49155513924914734, + "eval_loss": 0.555109441280365, + "eval_mean_token_accuracy": 0.8496399400539176, + "eval_num_tokens": 2008562.0, + "eval_runtime": 86.3295, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 860 + }, + { + "entropy": 0.4648668970912695, + "epoch": 2.1892901618929015, + "grad_norm": 0.8014165163040161, + "learning_rate": 0.00021671265263973133, + "loss": 0.4110250473022461, + "mean_token_accuracy": 0.8754166305065155, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.4909258722219356, + "eval_loss": 0.5539511442184448, + "eval_mean_token_accuracy": 0.8492401502160138, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.3468, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 880 + }, + { + "entropy": 0.4824485514312983, + "epoch": 2.2391033623910337, + "grad_norm": 0.6665191054344177, + "learning_rate": 0.00021590632851289967, + "loss": 0.4181404113769531, + "mean_token_accuracy": 0.8726993151009083, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.4986876940657926, + "eval_loss": 0.547695517539978, + "eval_mean_token_accuracy": 0.8501384708770486, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.3838, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 900 + }, + { + "entropy": 0.4751896943897009, + "epoch": 2.2889165628891655, + "grad_norm": 0.81158047914505, + "learning_rate": 0.00021506901138115678, + "loss": 0.40689678192138673, + "mean_token_accuracy": 0.8745221219956875, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.507153491121392, + "eval_loss": 0.5501641631126404, + "eval_mean_token_accuracy": 0.8495670116918032, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.0912, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 920 + }, + { + "entropy": 0.4873133715242147, + "epoch": 2.3387297633872977, + "grad_norm": 0.7218056321144104, + "learning_rate": 0.0002142009537679292, + "loss": 0.42701358795166017, + "mean_token_accuracy": 0.8695114746689796, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5202612736543943, + "eval_loss": 0.5491839051246643, + "eval_mean_token_accuracy": 0.8494071208460386, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.1142, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 940 + }, + { + "entropy": 0.4762951169162989, + "epoch": 2.3885429638854294, + "grad_norm": 0.7194424867630005, + "learning_rate": 0.0002133024174675534, + "loss": 0.42299847602844237, + "mean_token_accuracy": 0.8709790132939815, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4899340462546016, + "eval_loss": 0.5522511601448059, + "eval_mean_token_accuracy": 0.8492208258357159, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.463, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 960 + }, + { + "entropy": 0.49650347977876663, + "epoch": 2.4383561643835616, + "grad_norm": 0.8406022787094116, + "learning_rate": 0.0002123736734663221, + "loss": 0.4275330066680908, + "mean_token_accuracy": 0.8670595556497573, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.49691385654515996, + "eval_loss": 0.5491269826889038, + "eval_mean_token_accuracy": 0.850309816210769, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.17, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 980 + }, + { + "entropy": 0.48843890577554705, + "epoch": 2.488169364881694, + "grad_norm": 0.9082473516464233, + "learning_rate": 0.00021141500186075868, + "loss": 0.4309722423553467, + "mean_token_accuracy": 0.8686766296625137, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5543508351195691, + "eval_loss": 0.5478800535202026, + "eval_mean_token_accuracy": 0.8478029522784921, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.3835, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 1000 + }, + { + "entropy": 0.4777219031006098, + "epoch": 2.5379825653798256, + "grad_norm": 0.7448089122772217, + "learning_rate": 0.0002104266917731438, + "loss": 0.423325252532959, + "mean_token_accuracy": 0.8706337086856365, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.49857561550168106, + "eval_loss": 0.5511948466300964, + "eval_mean_token_accuracy": 0.8502220289651737, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.5399, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.988, + "step": 1020 + }, + { + "entropy": 0.4844174191355705, + "epoch": 2.587795765877958, + "grad_norm": 0.794029176235199, + "learning_rate": 0.00020940904126432, + "loss": 0.4176753044128418, + "mean_token_accuracy": 0.873535567522049, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.485467542222766, + "eval_loss": 0.5539286732673645, + "eval_mean_token_accuracy": 0.8495475081510322, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.135, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 1.997, + "step": 1040 + }, + { + "entropy": 0.49070929251611234, + "epoch": 2.6376089663760895, + "grad_norm": 0.7558256983757019, + "learning_rate": 0.0002083623572438007, + "loss": 0.42867293357849123, + "mean_token_accuracy": 0.8696666076779366, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.490822730889154, + "eval_loss": 0.5434785485267639, + "eval_mean_token_accuracy": 0.850568296950917, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.4933, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 1060 + }, + { + "entropy": 0.47806114703416824, + "epoch": 2.6874221668742218, + "grad_norm": 0.6608979105949402, + "learning_rate": 0.00020728695537721047, + "loss": 0.4289727687835693, + "mean_token_accuracy": 0.8693130135536193, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.5285773256490397, + "eval_loss": 0.5444230437278748, + "eval_mean_token_accuracy": 0.8498796481032704, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.7091, + "eval_samples_per_second": 15.858, + "eval_steps_per_second": 1.984, + "step": 1080 + }, + { + "entropy": 0.5046216730028391, + "epoch": 2.7372353673723535, + "grad_norm": 0.8428544998168945, + "learning_rate": 0.00020618315999108454, + "loss": 0.43131070137023925, + "mean_token_accuracy": 0.8701941035687923, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.49888394738352576, + "eval_loss": 0.5459766387939453, + "eval_mean_token_accuracy": 0.8511758872935938, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.2222, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.995, + "step": 1100 + }, + { + "entropy": 0.5212558470666409, + "epoch": 2.7870485678704857, + "grad_norm": 1.129318118095398, + "learning_rate": 0.00020505130397505635, + "loss": 0.44249300956726073, + "mean_token_accuracy": 0.8654101334512234, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5179622324053631, + "eval_loss": 0.5522801280021667, + "eval_mean_token_accuracy": 0.8497019947268242, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.1903, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.996, + "step": 1120 + }, + { + "entropy": 0.4988406613469124, + "epoch": 2.8368617683686175, + "grad_norm": 0.6460545063018799, + "learning_rate": 0.00020389172868146263, + "loss": 0.4386270523071289, + "mean_token_accuracy": 0.8690383620560169, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.5042278484203094, + "eval_loss": 0.5433034300804138, + "eval_mean_token_accuracy": 0.8497674451317898, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.3028, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.993, + "step": 1140 + }, + { + "entropy": 0.4926559619605541, + "epoch": 2.8866749688667497, + "grad_norm": 0.8199329972267151, + "learning_rate": 0.00020270478382239615, + "loss": 0.4313485145568848, + "mean_token_accuracy": 0.8674727231264114, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.503873193160046, + "eval_loss": 0.5388111472129822, + "eval_mean_token_accuracy": 0.8526195034731266, + "eval_num_tokens": 2710196.0, + "eval_runtime": 86.4054, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.991, + "step": 1160 + }, + { + "entropy": 0.5020013231784105, + "epoch": 2.936488169364882, + "grad_norm": 0.7344821095466614, + "learning_rate": 0.00020149082736423723, + "loss": 0.43590536117553713, + "mean_token_accuracy": 0.8671772189438343, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5368241809828337, + "eval_loss": 0.5355703830718994, + "eval_mean_token_accuracy": 0.8517617773871089, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.2945, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1180 + }, + { + "entropy": 0.5112275708466768, + "epoch": 2.9863013698630136, + "grad_norm": 0.6951606869697571, + "learning_rate": 0.00020025022541969622, + "loss": 0.43579301834106443, + "mean_token_accuracy": 0.8641206480562686, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.5066795706055885, + "eval_loss": 0.5415249466896057, + "eval_mean_token_accuracy": 0.8493563373421513, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.5005, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.988, + "step": 1200 + }, + { + "entropy": 0.42298635305502474, + "epoch": 3.0348692403486925, + "grad_norm": 0.8201794028282166, + "learning_rate": 0.00019898335213739863, + "loss": 0.35593905448913576, + "mean_token_accuracy": 0.889238600547497, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.4584170470750609, + "eval_loss": 0.569487452507019, + "eval_mean_token_accuracy": 0.8495814173027526, + "eval_num_tokens": 2848509.0, + "eval_runtime": 86.2281, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 1220 + }, + { + "entropy": 0.37450140453875064, + "epoch": 3.0846824408468243, + "grad_norm": 0.7308394908905029, + "learning_rate": 0.0001976905895890471, + "loss": 0.307823920249939, + "mean_token_accuracy": 0.9001288741827012, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.45185995916294497, + "eval_loss": 0.5672881603240967, + "eval_mean_token_accuracy": 0.8511318519364955, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.0819, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.998, + "step": 1240 + }, + { + "entropy": 0.3887945845723152, + "epoch": 3.1344956413449565, + "grad_norm": 0.7299330830574036, + "learning_rate": 0.0001963723276541939, + "loss": 0.32047903537750244, + "mean_token_accuracy": 0.8960984498262405, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.44865354549053105, + "eval_loss": 0.5666037201881409, + "eval_mean_token_accuracy": 0.8496572649063066, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 1260 + }, + { + "entropy": 0.39677664265036583, + "epoch": 3.1843088418430883, + "grad_norm": 0.9533219933509827, + "learning_rate": 0.00019502896390265838, + "loss": 0.3253983497619629, + "mean_token_accuracy": 0.8964207418262958, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.4641980809527774, + "eval_loss": 0.5814996957778931, + "eval_mean_token_accuracy": 0.8485886212005171, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.7784, + "eval_samples_per_second": 15.845, + "eval_steps_per_second": 1.982, + "step": 1280 + }, + { + "entropy": 0.39210722744464876, + "epoch": 3.2341220423412205, + "grad_norm": 0.7447651028633118, + "learning_rate": 0.00019366090347462545, + "loss": 0.3276803970336914, + "mean_token_accuracy": 0.8930055953562259, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43595615254585135, + "eval_loss": 0.5722188353538513, + "eval_mean_token_accuracy": 0.8501105755567551, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.5271, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 1300 + }, + { + "entropy": 0.3684127271175385, + "epoch": 3.2839352428393527, + "grad_norm": 0.6934201121330261, + "learning_rate": 0.00019226855895846078, + "loss": 0.3156379222869873, + "mean_token_accuracy": 0.8976306475698947, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.4628148723480313, + "eval_loss": 0.5631352066993713, + "eval_mean_token_accuracy": 0.8504934813394103, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.3436, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 1320 + }, + { + "entropy": 0.4073401909321547, + "epoch": 3.3337484433374844, + "grad_norm": 0.9386897683143616, + "learning_rate": 0.00019085235026627994, + "loss": 0.34265310764312745, + "mean_token_accuracy": 0.8902062118053437, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.46455050623694133, + "eval_loss": 0.5586736798286438, + "eval_mean_token_accuracy": 0.8506874702004499, + "eval_num_tokens": 3132874.0, + "eval_runtime": 86.1286, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.997, + "step": 1340 + }, + { + "entropy": 0.4046429242938757, + "epoch": 3.383561643835616, + "grad_norm": 0.9633992314338684, + "learning_rate": 0.00018941270450730836, + "loss": 0.33816893100738527, + "mean_token_accuracy": 0.8927541889250279, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.46846531660750856, + "eval_loss": 0.561501681804657, + "eval_mean_token_accuracy": 0.8496256377114806, + "eval_num_tokens": 3178055.0, + "eval_runtime": 86.685, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1360 + }, + { + "entropy": 0.39872407019138334, + "epoch": 3.4333748443337484, + "grad_norm": 0.7786458730697632, + "learning_rate": 0.00018795005585907113, + "loss": 0.33342490196228025, + "mean_token_accuracy": 0.8944805048406124, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.42709505973860273, + "eval_loss": 0.5751848220825195, + "eval_mean_token_accuracy": 0.8507290447867194, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.6892, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 1380 + }, + { + "entropy": 0.3923338124528527, + "epoch": 3.4831880448318806, + "grad_norm": 0.9305956363677979, + "learning_rate": 0.0001864648454364511, + "loss": 0.33188116550445557, + "mean_token_accuracy": 0.8943330392241478, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.4386174779298694, + "eval_loss": 0.5680831074714661, + "eval_mean_token_accuracy": 0.8513129727784977, + "eval_num_tokens": 3274096.0, + "eval_runtime": 86.2671, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 1400 + }, + { + "entropy": 0.3856233984231949, + "epoch": 3.5330012453300124, + "grad_norm": 1.0362752676010132, + "learning_rate": 0.0001849575211586545, + "loss": 0.33098697662353516, + "mean_token_accuracy": 0.8961390435695649, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4574795474493226, + "eval_loss": 0.5630439519882202, + "eval_mean_token_accuracy": 0.8520988873964133, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.6035, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 1420 + }, + { + "entropy": 0.39812871962785723, + "epoch": 3.5828144458281446, + "grad_norm": 0.7807195782661438, + "learning_rate": 0.0001834285376141247, + "loss": 0.3333771228790283, + "mean_token_accuracy": 0.8930827379226685, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.4556825893909432, + "eval_loss": 0.5689062476158142, + "eval_mean_token_accuracy": 0.8507103507601937, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.1606, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.996, + "step": 1440 + }, + { + "entropy": 0.4147744856774807, + "epoch": 3.6326276463262763, + "grad_norm": 0.6429352164268494, + "learning_rate": 0.00018187835592344443, + "loss": 0.3482560873031616, + "mean_token_accuracy": 0.8910200245678425, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.46600024540757023, + "eval_loss": 0.5609709024429321, + "eval_mean_token_accuracy": 0.8491220876227977, + "eval_num_tokens": 3415600.0, + "eval_runtime": 86.8039, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1460 + }, + { + "entropy": 0.40425071083009245, + "epoch": 3.6824408468244085, + "grad_norm": 0.8613698482513428, + "learning_rate": 0.0001803074436002682, + "loss": 0.342916464805603, + "mean_token_accuracy": 0.8916418336331844, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.43855057899342026, + "eval_loss": 0.5720968246459961, + "eval_mean_token_accuracy": 0.8500823641932288, + "eval_num_tokens": 3460471.0, + "eval_runtime": 86.6746, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1480 + }, + { + "entropy": 0.39465143866837027, + "epoch": 3.7322540473225407, + "grad_norm": 0.6285189986228943, + "learning_rate": 0.0001787162744103265, + "loss": 0.3424591779708862, + "mean_token_accuracy": 0.8906558901071548, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4509461877304454, + "eval_loss": 0.5590082406997681, + "eval_mean_token_accuracy": 0.8511747371318729, + "eval_num_tokens": 3507647.0, + "eval_runtime": 86.8126, + "eval_samples_per_second": 15.839, + "eval_steps_per_second": 1.981, + "step": 1500 + }, + { + "entropy": 0.4021005939692259, + "epoch": 3.7820672478206725, + "grad_norm": 0.8821248412132263, + "learning_rate": 0.00017710532822854468, + "loss": 0.3462103843688965, + "mean_token_accuracy": 0.889109355956316, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.4502199075596277, + "eval_loss": 0.566046416759491, + "eval_mean_token_accuracy": 0.8501714208098345, + "eval_num_tokens": 3548934.0, + "eval_runtime": 86.8336, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.981, + "step": 1520 + }, + { + "entropy": 0.4017397932708263, + "epoch": 3.8318804483188043, + "grad_norm": 0.8400952816009521, + "learning_rate": 0.0001754750908943189, + "loss": 0.34890995025634763, + "mean_token_accuracy": 0.8892098367214203, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.4614003023435903, + "eval_loss": 0.5617933869361877, + "eval_mean_token_accuracy": 0.8515863616106122, + "eval_num_tokens": 3597186.0, + "eval_runtime": 86.4609, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 1540 + }, + { + "entropy": 0.4112051840871572, + "epoch": 3.8816936488169365, + "grad_norm": 0.769478440284729, + "learning_rate": 0.0001738260540649939, + "loss": 0.34711437225341796, + "mean_token_accuracy": 0.8911717928946018, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4540443811998811, + "eval_loss": 0.5576469898223877, + "eval_mean_token_accuracy": 0.8512079674144124, + "eval_num_tokens": 3646646.0, + "eval_runtime": 86.5103, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 1560 + }, + { + "entropy": 0.41105241514742374, + "epoch": 3.9315068493150687, + "grad_norm": 0.8468427062034607, + "learning_rate": 0.00017215871506758568, + "loss": 0.3433023452758789, + "mean_token_accuracy": 0.8898739732801915, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.4707539707075718, + "eval_loss": 0.5641466379165649, + "eval_mean_token_accuracy": 0.8495440957851188, + "eval_num_tokens": 3689560.0, + "eval_runtime": 86.609, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.986, + "step": 1580 + }, + { + "entropy": 0.41016379147768023, + "epoch": 3.9813200498132004, + "grad_norm": 0.7482675313949585, + "learning_rate": 0.0001704735767487946, + "loss": 0.34550890922546384, + "mean_token_accuracy": 0.8893028847873211, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.46391099864660307, + "eval_loss": 0.5593640804290771, + "eval_mean_token_accuracy": 0.8510130581467651, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.3975, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 1600 + }, + { + "entropy": 0.33167599791135544, + "epoch": 4.029887920298879, + "grad_norm": 0.9435692429542542, + "learning_rate": 0.00016877114732335337, + "loss": 0.2716026544570923, + "mean_token_accuracy": 0.9133149828666296, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.38499350005457567, + "eval_loss": 0.6298249363899231, + "eval_mean_token_accuracy": 0.8488117071778275, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.2933, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1620 + }, + { + "entropy": 0.3000166634097695, + "epoch": 4.0797011207970115, + "grad_norm": 0.8080845475196838, + "learning_rate": 0.0001670519402207569, + "loss": 0.22617182731628419, + "mean_token_accuracy": 0.9253474645316601, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.370110988703578, + "eval_loss": 0.6338461637496948, + "eval_mean_token_accuracy": 0.8485634801692741, + "eval_num_tokens": 3828830.0, + "eval_runtime": 85.9508, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.001, + "step": 1640 + }, + { + "entropy": 0.2986910421401262, + "epoch": 4.129514321295143, + "grad_norm": 0.7310900092124939, + "learning_rate": 0.0001653164739304185, + "loss": 0.22367463111877442, + "mean_token_accuracy": 0.9252275295555592, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.3944379702037157, + "eval_loss": 0.6109381914138794, + "eval_mean_token_accuracy": 0.849291454220927, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.6728, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1660 + }, + { + "entropy": 0.3095553796738386, + "epoch": 4.179327521793275, + "grad_norm": 0.7059140801429749, + "learning_rate": 0.0001635652718453007, + "loss": 0.23651680946350098, + "mean_token_accuracy": 0.9208931416273117, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.3910588648949945, + "eval_loss": 0.6104469299316406, + "eval_mean_token_accuracy": 0.8486883893262508, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7612, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.982, + "step": 1680 + }, + { + "entropy": 0.3001101028174162, + "epoch": 4.229140722291407, + "grad_norm": 0.6787802577018738, + "learning_rate": 0.00016179886210406728, + "loss": 0.23130471706390382, + "mean_token_accuracy": 0.9233332790434361, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3794369170832079, + "eval_loss": 0.6182110905647278, + "eval_mean_token_accuracy": 0.8495433777570724, + "eval_num_tokens": 3967474.0, + "eval_runtime": 85.94, + "eval_samples_per_second": 16.0, + "eval_steps_per_second": 2.001, + "step": 1700 + }, + { + "entropy": 0.3031421799212694, + "epoch": 4.2789539227895395, + "grad_norm": 0.9732038378715515, + "learning_rate": 0.0001600177774318036, + "loss": 0.2359529733657837, + "mean_token_accuracy": 0.9217648565769195, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3923123094231583, + "eval_loss": 0.6057384610176086, + "eval_mean_token_accuracy": 0.8508818288182103, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7647, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.29365369994193313, + "epoch": 4.328767123287671, + "grad_norm": 0.7681498527526855, + "learning_rate": 0.0001582225549793541, + "loss": 0.2269371747970581, + "mean_token_accuracy": 0.9245341829955578, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.4011661055129628, + "eval_loss": 0.6144486665725708, + "eval_mean_token_accuracy": 0.8480324357054955, + "eval_num_tokens": 4062594.0, + "eval_runtime": 87.1306, + "eval_samples_per_second": 15.781, + "eval_steps_per_second": 1.974, + "step": 1740 + }, + { + "entropy": 0.29396994728595016, + "epoch": 4.378580323785803, + "grad_norm": 1.0001007318496704, + "learning_rate": 0.0001564137361613248, + "loss": 0.22777395248413085, + "mean_token_accuracy": 0.9262309700250626, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38518730195802314, + "eval_loss": 0.6202630400657654, + "eval_mean_token_accuracy": 0.8493869807137999, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6616, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.3096018506214023, + "epoch": 4.428393524283935, + "grad_norm": 1.0448365211486816, + "learning_rate": 0.00015459186649280024, + "loss": 0.23696351051330566, + "mean_token_accuracy": 0.9217322513461113, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.3946371126140273, + "eval_loss": 0.6079026460647583, + "eval_mean_token_accuracy": 0.8492515852978063, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6582, + "eval_samples_per_second": 15.867, + "eval_steps_per_second": 1.985, + "step": 1780 + }, + { + "entropy": 0.32619857545942066, + "epoch": 4.478206724782067, + "grad_norm": 0.7210651636123657, + "learning_rate": 0.00015275749542482337, + "loss": 0.24651215076446534, + "mean_token_accuracy": 0.9177676141262054, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.3947690814560236, + "eval_loss": 0.6065912246704102, + "eval_mean_token_accuracy": 0.8502957744653835, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.5959, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.986, + "step": 1800 + }, + { + "entropy": 0.3193941755220294, + "epoch": 4.5280199252802, + "grad_norm": 0.8281906843185425, + "learning_rate": 0.0001509111761786888, + "loss": 0.23936262130737304, + "mean_token_accuracy": 0.9201708927750587, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38704028864239537, + "eval_loss": 0.6006569266319275, + "eval_mean_token_accuracy": 0.8502406720505205, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.8059, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1820 + }, + { + "entropy": 0.3164879363030195, + "epoch": 4.577833125778331, + "grad_norm": 0.7892968654632568, + "learning_rate": 0.00014905346557909867, + "loss": 0.24541733264923096, + "mean_token_accuracy": 0.9175932116806507, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.38861122120951497, + "eval_loss": 0.6115967631340027, + "eval_mean_token_accuracy": 0.849471275196519, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.2946, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1840 + }, + { + "entropy": 0.3051785985007882, + "epoch": 4.627646326276463, + "grad_norm": 0.8109654188156128, + "learning_rate": 0.0001471849238862319, + "loss": 0.23433220386505127, + "mean_token_accuracy": 0.9206570319831371, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.37162452295076015, + "eval_loss": 0.6184061765670776, + "eval_mean_token_accuracy": 0.8501173268223918, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.6865, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1860 + }, + { + "entropy": 0.3168198253959417, + "epoch": 4.677459526774595, + "grad_norm": 0.9512342214584351, + "learning_rate": 0.0001453061146267775, + "loss": 0.23832404613494873, + "mean_token_accuracy": 0.9197044663131237, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3845940856912801, + "eval_loss": 0.606762707233429, + "eval_mean_token_accuracy": 0.8504838194957999, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.5175, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 1880 + }, + { + "entropy": 0.30791807882487776, + "epoch": 4.7272727272727275, + "grad_norm": 0.8123113512992859, + "learning_rate": 0.00014341760442398248, + "loss": 0.2395785331726074, + "mean_token_accuracy": 0.918928150832653, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.39762327222283494, + "eval_loss": 0.5994202494621277, + "eval_mean_token_accuracy": 0.8509274201337681, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.2873, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.993, + "step": 1900 + }, + { + "entropy": 0.3021434534341097, + "epoch": 4.777085927770859, + "grad_norm": 0.731787383556366, + "learning_rate": 0.000141519962826766, + "loss": 0.23494718074798585, + "mean_token_accuracy": 0.9201403826475143, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.3827026732439219, + "eval_loss": 0.5995895862579346, + "eval_mean_token_accuracy": 0.851468373523202, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.3006, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 1920 + }, + { + "entropy": 0.31626159623265265, + "epoch": 4.826899128268991, + "grad_norm": 0.8848487138748169, + "learning_rate": 0.00013961376213795132, + "loss": 0.2439030647277832, + "mean_token_accuracy": 0.9196575872600079, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.388698436839636, + "eval_loss": 0.6000174283981323, + "eval_mean_token_accuracy": 0.8518068187458571, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.8979, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.979, + "step": 1940 + }, + { + "entropy": 0.30520407035946845, + "epoch": 4.876712328767123, + "grad_norm": 0.8532460927963257, + "learning_rate": 0.00013769957724166695, + "loss": 0.23458616733551024, + "mean_token_accuracy": 0.9221912942826748, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.38777847102908203, + "eval_loss": 0.6004981398582458, + "eval_mean_token_accuracy": 0.8516481768253238, + "eval_num_tokens": 4578167.0, + "eval_runtime": 87.0777, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.975, + "step": 1960 + }, + { + "entropy": 0.3226448342204094, + "epoch": 4.926525529265255, + "grad_norm": 0.6945561766624451, + "learning_rate": 0.0001357779854299694, + "loss": 0.24048397541046143, + "mean_token_accuracy": 0.9195300146937371, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.38581624263247777, + "eval_loss": 0.6029234528541565, + "eval_mean_token_accuracy": 0.8514213260523108, + "eval_num_tokens": 4622316.0, + "eval_runtime": 85.8729, + "eval_samples_per_second": 16.012, + "eval_steps_per_second": 2.003, + "step": 1980 + }, + { + "entropy": 0.3051655298098922, + "epoch": 4.976338729763388, + "grad_norm": 0.7976452708244324, + "learning_rate": 0.00013384956622874001, + "loss": 0.23584742546081544, + "mean_token_accuracy": 0.9216851457953453, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.37913159246361533, + "eval_loss": 0.6057604551315308, + "eval_mean_token_accuracy": 0.8525801203971686, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.1145, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 2000 + }, + { + "entropy": 0.27438195240803254, + "epoch": 5.024906600249066, + "grad_norm": 0.6729586124420166, + "learning_rate": 0.0001319149012229075, + "loss": 0.19775952100753785, + "mean_token_accuracy": 0.9339428559327737, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.3448961910813354, + "eval_loss": 0.6750120520591736, + "eval_mean_token_accuracy": 0.8487970232963562, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.1169, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 2020 + }, + { + "entropy": 0.21423916313797237, + "epoch": 5.074719800747198, + "grad_norm": 0.6934391856193542, + "learning_rate": 0.00012997457388105022, + "loss": 0.1439570426940918, + "mean_token_accuracy": 0.9528236843645572, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.3570949243771475, + "eval_loss": 0.6465504169464111, + "eval_mean_token_accuracy": 0.8490785547467166, + "eval_num_tokens": 4763269.0, + "eval_runtime": 85.9574, + "eval_samples_per_second": 15.996, + "eval_steps_per_second": 2.001, + "step": 2040 + }, + { + "entropy": 0.20838565267622472, + "epoch": 5.12453300124533, + "grad_norm": 0.7286986112594604, + "learning_rate": 0.00012802916937942972, + "loss": 0.14467307329177856, + "mean_token_accuracy": 0.950994835793972, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.3452463157821533, + "eval_loss": 0.6705958843231201, + "eval_mean_token_accuracy": 0.8490352796953778, + "eval_num_tokens": 4809047.0, + "eval_runtime": 86.228, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 2060 + }, + { + "entropy": 0.20453082229942082, + "epoch": 5.174346201743462, + "grad_norm": 0.7515555620193481, + "learning_rate": 0.00012607927442550974, + "loss": 0.13732000589370727, + "mean_token_accuracy": 0.9537357829511166, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.32431264914745506, + "eval_loss": 0.6743043065071106, + "eval_mean_token_accuracy": 0.8504878629085629, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.5948, + "eval_samples_per_second": 15.879, + "eval_steps_per_second": 1.986, + "step": 2080 + }, + { + "entropy": 0.21812320686876774, + "epoch": 5.224159402241594, + "grad_norm": 0.9093465209007263, + "learning_rate": 0.0001241254770810132, + "loss": 0.14311420917510986, + "mean_token_accuracy": 0.9514068141579628, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.33086285835435225, + "eval_loss": 0.6676449179649353, + "eval_mean_token_accuracy": 0.8505287662495015, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 2100 + }, + { + "entropy": 0.2180163251236081, + "epoch": 5.273972602739726, + "grad_norm": 0.6703007221221924, + "learning_rate": 0.00012216836658457075, + "loss": 0.14803968667984008, + "mean_token_accuracy": 0.9521303348243236, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.33162341708707255, + "eval_loss": 0.6658875942230225, + "eval_mean_token_accuracy": 0.8500757605530495, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.6296, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 2120 + }, + { + "entropy": 0.22511130161583423, + "epoch": 5.323785803237858, + "grad_norm": 0.8078880906105042, + "learning_rate": 0.00012020853317401455, + "loss": 0.15228408575057983, + "mean_token_accuracy": 0.947144789993763, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3354601170434508, + "eval_loss": 0.6677829623222351, + "eval_mean_token_accuracy": 0.8482600024273229, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.4689, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.989, + "step": 2140 + }, + { + "entropy": 0.2244176059961319, + "epoch": 5.37359900373599, + "grad_norm": 0.9636075496673584, + "learning_rate": 0.00011824656790837037, + "loss": 0.15260883569717407, + "mean_token_accuracy": 0.9471467643976211, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.3381616926297199, + "eval_loss": 0.6694412231445312, + "eval_mean_token_accuracy": 0.8482369603805764, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.4147, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 2160 + }, + { + "entropy": 0.22982364390045404, + "epoch": 5.423412204234122, + "grad_norm": 0.775401771068573, + "learning_rate": 0.00011628306248960262, + "loss": 0.15140302181243898, + "mean_token_accuracy": 0.9492553934454918, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.3305150235808173, + "eval_loss": 0.6717822551727295, + "eval_mean_token_accuracy": 0.8489849723355715, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.4728, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.989, + "step": 2180 + }, + { + "entropy": 0.21448935717344284, + "epoch": 5.473225404732254, + "grad_norm": 0.6575281023979187, + "learning_rate": 0.00011431860908416465, + "loss": 0.1452319622039795, + "mean_token_accuracy": 0.9505287684500218, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3488145174328671, + "eval_loss": 0.6612305641174316, + "eval_mean_token_accuracy": 0.8492907808963642, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6927, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 2200 + }, + { + "entropy": 0.23091202937066554, + "epoch": 5.523038605230386, + "grad_norm": 0.8909686207771301, + "learning_rate": 0.00011235380014440985, + "loss": 0.15150139331817628, + "mean_token_accuracy": 0.9497875183820724, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.3268539015810157, + "eval_loss": 0.6667542457580566, + "eval_mean_token_accuracy": 0.8499062903398691, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.4644, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 2220 + }, + { + "entropy": 0.2227974807843566, + "epoch": 5.572851805728518, + "grad_norm": 0.6180275082588196, + "learning_rate": 0.0001103892282299158, + "loss": 0.1491069197654724, + "mean_token_accuracy": 0.9488144010305405, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3346347655494546, + "eval_loss": 0.6665948629379272, + "eval_mean_token_accuracy": 0.8499961893918903, + "eval_num_tokens": 5226864.0, + "eval_runtime": 87.0548, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.976, + "step": 2240 + }, + { + "entropy": 0.21368421968072654, + "epoch": 5.62266500622665, + "grad_norm": 0.6004369258880615, + "learning_rate": 0.00010842548582877651, + "loss": 0.14485255479812623, + "mean_token_accuracy": 0.9502056457102299, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.32753298804163933, + "eval_loss": 0.6680151224136353, + "eval_mean_token_accuracy": 0.8515451086121936, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.8524, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.98, + "step": 2260 + }, + { + "entropy": 0.2103635374456644, + "epoch": 5.672478206724782, + "grad_norm": 0.699174702167511, + "learning_rate": 0.00010646316517891613, + "loss": 0.14297772645950318, + "mean_token_accuracy": 0.9512537539005279, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.32966585959806, + "eval_loss": 0.675578773021698, + "eval_mean_token_accuracy": 0.8509623023659684, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.4518, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.99, + "step": 2280 + }, + { + "entropy": 0.22516900151968003, + "epoch": 5.722291407222914, + "grad_norm": 0.6637354493141174, + "learning_rate": 0.00010450285808947797, + "loss": 0.15202572345733642, + "mean_token_accuracy": 0.9482452072203159, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3369456917740578, + "eval_loss": 0.6697061061859131, + "eval_mean_token_accuracy": 0.848603522361711, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.6371, + "eval_samples_per_second": 15.871, + "eval_steps_per_second": 1.985, + "step": 2300 + }, + { + "entropy": 0.21841065725311637, + "epoch": 5.772104607721046, + "grad_norm": 0.7940268516540527, + "learning_rate": 0.00010254515576234297, + "loss": 0.14710167646408082, + "mean_token_accuracy": 0.9493498183786869, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3237486180177955, + "eval_loss": 0.6779657602310181, + "eval_mean_token_accuracy": 0.8500715313955794, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.1826, + "eval_samples_per_second": 15.954, + "eval_steps_per_second": 1.996, + "step": 2320 + }, + { + "entropy": 0.22146204356104135, + "epoch": 5.821917808219178, + "grad_norm": 0.9234833121299744, + "learning_rate": 0.00010059064861383132, + "loss": 0.14720046520233154, + "mean_token_accuracy": 0.9493872679769992, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.32365207564692167, + "eval_loss": 0.6704005002975464, + "eval_mean_token_accuracy": 0.8507985760306203, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.5494, + "eval_samples_per_second": 15.887, + "eval_steps_per_second": 1.987, + "step": 2340 + }, + { + "entropy": 0.20934011954814197, + "epoch": 5.87173100871731, + "grad_norm": 0.5547503232955933, + "learning_rate": 9.863992609664084e-05, + "loss": 0.1464867353439331, + "mean_token_accuracy": 0.9503875687718392, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.3330401429083458, + "eval_loss": 0.6659091114997864, + "eval_mean_token_accuracy": 0.8504848906467127, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.5855, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 2360 + }, + { + "entropy": 0.21678635366261007, + "epoch": 5.921544209215442, + "grad_norm": 0.570612907409668, + "learning_rate": 9.669357652207635e-05, + "loss": 0.14821385145187377, + "mean_token_accuracy": 0.9503940217196941, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3322022325077722, + "eval_loss": 0.6722489595413208, + "eval_mean_token_accuracy": 0.8489979422369669, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.2986, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 2380 + }, + { + "entropy": 0.20932920072227718, + "epoch": 5.971357409713574, + "grad_norm": 0.7879557609558105, + "learning_rate": 9.475218688262262e-05, + "loss": 0.14675841331481934, + "mean_token_accuracy": 0.9507176131010056, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.3199348642902319, + "eval_loss": 0.6698136329650879, + "eval_mean_token_accuracy": 0.8514142130003419, + "eval_num_tokens": 5605400.0, + "eval_runtime": 85.8995, + "eval_samples_per_second": 16.007, + "eval_steps_per_second": 2.002, + "step": 2400 + }, + { + "entropy": 0.21032143919131693, + "epoch": 6.019925280199253, + "grad_norm": 0.5823076367378235, + "learning_rate": 9.281634267491569e-05, + "loss": 0.13322267532348633, + "mean_token_accuracy": 0.9550939072401096, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.30206270117399303, + "eval_loss": 0.7093168497085571, + "eval_mean_token_accuracy": 0.8500627639681794, + "eval_num_tokens": 5648968.0, + "eval_runtime": 85.8128, + "eval_samples_per_second": 16.023, + "eval_steps_per_second": 2.004, + "step": 2420 + }, + { + "entropy": 0.1534628233872354, + "epoch": 6.069738480697385, + "grad_norm": 0.710133969783783, + "learning_rate": 9.088662772316508e-05, + "loss": 0.09078952670097351, + "mean_token_accuracy": 0.9678447999060154, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.28208133101809857, + "eval_loss": 0.7636417150497437, + "eval_mean_token_accuracy": 0.8494061477655588, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9724, + "eval_samples_per_second": 15.994, + "eval_steps_per_second": 2.001, + "step": 2440 + }, + { + "entropy": 0.16151462448760867, + "epoch": 6.119551681195516, + "grad_norm": 0.5793812274932861, + "learning_rate": 8.896362400308028e-05, + "loss": 0.09545697569847107, + "mean_token_accuracy": 0.9671573750674725, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.2833245605403601, + "eval_loss": 0.7402405738830566, + "eval_mean_token_accuracy": 0.8503523728875226, + "eval_num_tokens": 5745090.0, + "eval_runtime": 85.5461, + "eval_samples_per_second": 16.073, + "eval_steps_per_second": 2.011, + "step": 2460 + }, + { + "entropy": 0.15203177919611335, + "epoch": 6.169364881693649, + "grad_norm": 0.4251123368740082, + "learning_rate": 8.704791146635483e-05, + "loss": 0.09420782327651978, + "mean_token_accuracy": 0.9677386932075024, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.28572545962971313, + "eval_loss": 0.735416829586029, + "eval_mean_token_accuracy": 0.8487084663884584, + "eval_num_tokens": 5790333.0, + "eval_runtime": 85.4801, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.012, + "step": 2480 + }, + { + "entropy": 0.15587336672469973, + "epoch": 6.219178082191781, + "grad_norm": 0.4357028007507324, + "learning_rate": 8.514006786576085e-05, + "loss": 0.09429320096969604, + "mean_token_accuracy": 0.9682952925562859, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.2859006894882335, + "eval_loss": 0.7347224950790405, + "eval_mean_token_accuracy": 0.8501905518215757, + "eval_num_tokens": 5837321.0, + "eval_runtime": 85.7578, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.006, + "step": 2500 + }, + { + "entropy": 0.15765639198943973, + "epoch": 6.268991282689913, + "grad_norm": 0.47331130504608154, + "learning_rate": 8.324066858090663e-05, + "loss": 0.09571113586425781, + "mean_token_accuracy": 0.9683481335639954, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.29231513846059176, + "eval_loss": 0.7392512559890747, + "eval_mean_token_accuracy": 0.8486633983462356, + "eval_num_tokens": 5884398.0, + "eval_runtime": 85.7846, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.005, + "step": 2520 + }, + { + "entropy": 0.16176860257983208, + "epoch": 6.318804483188045, + "grad_norm": 0.6142018437385559, + "learning_rate": 8.135028644470992e-05, + "loss": 0.09486144185066223, + "mean_token_accuracy": 0.9682316601276397, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.2851274753379267, + "eval_loss": 0.7520816922187805, + "eval_mean_token_accuracy": 0.8501113649717597, + "eval_num_tokens": 5929876.0, + "eval_runtime": 85.9425, + "eval_samples_per_second": 15.999, + "eval_steps_per_second": 2.001, + "step": 2540 + }, + { + "entropy": 0.15404034564271568, + "epoch": 6.3686176836861765, + "grad_norm": 0.6051287651062012, + "learning_rate": 7.946949157063964e-05, + "loss": 0.09280472993850708, + "mean_token_accuracy": 0.9684635892510414, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28802703563557114, + "eval_loss": 0.7439162135124207, + "eval_mean_token_accuracy": 0.8499851770872293, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.0703, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.998, + "step": 2560 + }, + { + "entropy": 0.15343588953837753, + "epoch": 6.418430884184309, + "grad_norm": 0.4823743402957916, + "learning_rate": 7.759885118077701e-05, + "loss": 0.09000591039657593, + "mean_token_accuracy": 0.9699928767979145, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2795634938533916, + "eval_loss": 0.7647850513458252, + "eval_mean_token_accuracy": 0.8503464397995971, + "eval_num_tokens": 6025380.0, + "eval_runtime": 85.8886, + "eval_samples_per_second": 16.009, + "eval_steps_per_second": 2.003, + "step": 2580 + }, + { + "entropy": 0.15740026142448188, + "epoch": 6.468244084682441, + "grad_norm": 0.5082696676254272, + "learning_rate": 7.57389294347494e-05, + "loss": 0.09191849827766418, + "mean_token_accuracy": 0.9692809768021107, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2913342311458532, + "eval_loss": 0.7518694996833801, + "eval_mean_token_accuracy": 0.8483168302580367, + "eval_num_tokens": 6073349.0, + "eval_runtime": 85.5761, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.01, + "step": 2600 + }, + { + "entropy": 0.15922069251537324, + "epoch": 6.518057285180573, + "grad_norm": 0.3995199501514435, + "learning_rate": 7.389028725958736e-05, + "loss": 0.09584367871284485, + "mean_token_accuracy": 0.9685114495456218, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.2863075934177221, + "eval_loss": 0.7539381384849548, + "eval_mean_token_accuracy": 0.8507507083027862, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.112, + "eval_samples_per_second": 15.968, + "eval_steps_per_second": 1.997, + "step": 2620 + }, + { + "entropy": 0.16197575423866512, + "epoch": 6.567870485678705, + "grad_norm": 0.534295380115509, + "learning_rate": 7.205348218055678e-05, + "loss": 0.0961170256137848, + "mean_token_accuracy": 0.9674530044198036, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.29021967315050057, + "eval_loss": 0.751198947429657, + "eval_mean_token_accuracy": 0.8509796344956686, + "eval_num_tokens": 6165523.0, + "eval_runtime": 85.7958, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.005, + "step": 2640 + }, + { + "entropy": 0.15261746793985367, + "epoch": 6.617683686176837, + "grad_norm": 0.5391237139701843, + "learning_rate": 7.022906815301673e-05, + "loss": 0.0926026999950409, + "mean_token_accuracy": 0.9695659473538398, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.29128045216202736, + "eval_loss": 0.7450292110443115, + "eval_mean_token_accuracy": 0.8498771443616512, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.3963, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 2660 + }, + { + "entropy": 0.16164180357009172, + "epoch": 6.667496886674969, + "grad_norm": 0.5767946243286133, + "learning_rate": 6.841759539535419e-05, + "loss": 0.09291981458663941, + "mean_token_accuracy": 0.9687136687338352, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2897637223088464, + "eval_loss": 0.7503410577774048, + "eval_mean_token_accuracy": 0.8503315164599308, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.0653, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.998, + "step": 2680 + }, + { + "entropy": 0.17062523355707526, + "epoch": 6.717310087173101, + "grad_norm": 0.4974168539047241, + "learning_rate": 6.661961022304563e-05, + "loss": 0.09713236689567566, + "mean_token_accuracy": 0.9661971725523472, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2765843396963075, + "eval_loss": 0.7604002356529236, + "eval_mean_token_accuracy": 0.8521115277395692, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.1676, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 2700 + }, + { + "entropy": 0.17544092936441302, + "epoch": 6.767123287671232, + "grad_norm": 0.5523537993431091, + "learning_rate": 6.483565488389582e-05, + "loss": 0.09709116220474243, + "mean_token_accuracy": 0.9650957375764847, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.27939334659035814, + "eval_loss": 0.7534670829772949, + "eval_mean_token_accuracy": 0.851230604010959, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.2913, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 2720 + }, + { + "entropy": 0.15991022661328316, + "epoch": 6.816936488169365, + "grad_norm": 0.478551983833313, + "learning_rate": 6.306626739450311e-05, + "loss": 0.09564646482467651, + "mean_token_accuracy": 0.9679084822535515, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.27878295491601146, + "eval_loss": 0.7519959211349487, + "eval_mean_token_accuracy": 0.8510654949864676, + "eval_num_tokens": 6397720.0, + "eval_runtime": 85.9109, + "eval_samples_per_second": 16.005, + "eval_steps_per_second": 2.002, + "step": 2740 + }, + { + "entropy": 0.16824879590421915, + "epoch": 6.866749688667497, + "grad_norm": 0.6681098937988281, + "learning_rate": 6.131198137800108e-05, + "loss": 0.0962279736995697, + "mean_token_accuracy": 0.966830012947321, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.2834690434121808, + "eval_loss": 0.751922070980072, + "eval_mean_token_accuracy": 0.8521237577809844, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.3618, + "eval_samples_per_second": 15.921, + "eval_steps_per_second": 1.992, + "step": 2760 + }, + { + "entropy": 0.1518704930320382, + "epoch": 6.916562889165629, + "grad_norm": 0.5201290249824524, + "learning_rate": 5.957332590312513e-05, + "loss": 0.09010660648345947, + "mean_token_accuracy": 0.9693463340401649, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.28485129617674404, + "eval_loss": 0.7452457547187805, + "eval_mean_token_accuracy": 0.8512036796919135, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.4524, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.99, + "step": 2780 + }, + { + "entropy": 0.15512610590085388, + "epoch": 6.966376089663761, + "grad_norm": 0.42802050709724426, + "learning_rate": 5.785082532465233e-05, + "loss": 0.09320432543754578, + "mean_token_accuracy": 0.9686134628951549, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.27554594526110693, + "eval_loss": 0.7644653916358948, + "eval_mean_token_accuracy": 0.8513738523389018, + "eval_num_tokens": 6540175.0, + "eval_runtime": 85.7609, + "eval_samples_per_second": 16.033, + "eval_steps_per_second": 2.006, + "step": 2800 + }, + { + "entropy": 0.17524497526196334, + "epoch": 7.01494396014944, + "grad_norm": 0.3330269157886505, + "learning_rate": 5.6144999125263545e-05, + "loss": 0.0895616888999939, + "mean_token_accuracy": 0.9682766932707566, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.2735865569218647, + "eval_loss": 0.768479585647583, + "eval_mean_token_accuracy": 0.8503459383581959, + "eval_num_tokens": 6583767.0, + "eval_runtime": 85.7162, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.007, + "step": 2820 + }, + { + "entropy": 0.1403565663844347, + "epoch": 7.064757160647572, + "grad_norm": 0.35613498091697693, + "learning_rate": 5.4456361758874235e-05, + "loss": 0.07551313638687134, + "mean_token_accuracy": 0.9739301167428493, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.25941789089593775, + "eval_loss": 0.8209511637687683, + "eval_mean_token_accuracy": 0.8505055855873019, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.0943, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 2840 + }, + { + "entropy": 0.13500106502324344, + "epoch": 7.114570361145703, + "grad_norm": 0.34418627619743347, + "learning_rate": 5.2785422495482234e-05, + "loss": 0.07293946146965027, + "mean_token_accuracy": 0.9747208289802074, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.26482899772912954, + "eval_loss": 0.798904538154602, + "eval_mean_token_accuracy": 0.8511530233677044, + "eval_num_tokens": 6672946.0, + "eval_runtime": 85.7915, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.005, + "step": 2860 + }, + { + "entropy": 0.13127502552233636, + "epoch": 7.164383561643835, + "grad_norm": 0.4638441503047943, + "learning_rate": 5.113268526757892e-05, + "loss": 0.07121461629867554, + "mean_token_accuracy": 0.9756786689162255, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2645381211714689, + "eval_loss": 0.809101939201355, + "eval_mean_token_accuracy": 0.8514727898115335, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.84, + "eval_samples_per_second": 16.018, + "eval_steps_per_second": 2.004, + "step": 2880 + }, + { + "entropy": 0.1331390908919275, + "epoch": 7.214196762141968, + "grad_norm": 0.40206775069236755, + "learning_rate": 4.949864851817007e-05, + "loss": 0.07188264131546021, + "mean_token_accuracy": 0.9755406074225903, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.26244733283339544, + "eval_loss": 0.8143188953399658, + "eval_mean_token_accuracy": 0.8514358189909957, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.8546, + "eval_samples_per_second": 16.015, + "eval_steps_per_second": 2.003, + "step": 2900 + }, + { + "entropy": 0.13647331558167936, + "epoch": 7.2640099626401, + "grad_norm": 0.26405787467956543, + "learning_rate": 4.788380505045224e-05, + "loss": 0.07412450313568116, + "mean_token_accuracy": 0.9744274213910102, + "num_tokens": 6809678.0, + "step": 2920 + }, + { + "epoch": 7.2640099626401, + "eval_entropy": 0.2626111418182074, + "eval_loss": 0.8111525177955627, + "eval_mean_token_accuracy": 0.8512121695418691, + "eval_num_tokens": 6809678.0, + "eval_runtime": 85.9626, + "eval_samples_per_second": 15.995, + "eval_steps_per_second": 2.001, + "step": 2920 + }, + { + "entropy": 0.12644002586603165, + "epoch": 7.313823163138232, + "grad_norm": 0.27514681220054626, + "learning_rate": 4.6288641879189884e-05, + "loss": 0.06807711124420165, + "mean_token_accuracy": 0.9760703906416893, + "num_tokens": 6860750.0, + "step": 2940 + }, + { + "epoch": 7.313823163138232, + "eval_entropy": 0.26096762734097106, + "eval_loss": 0.8184595108032227, + "eval_mean_token_accuracy": 0.8501476153384807, + "eval_num_tokens": 6860750.0, + "eval_runtime": 85.9521, + "eval_samples_per_second": 15.997, + "eval_steps_per_second": 2.001, + "step": 2940 + }, + { + "entropy": 0.13920630998909472, + "epoch": 7.363636363636363, + "grad_norm": 0.23584705591201782, + "learning_rate": 4.4713640083838604e-05, + "loss": 0.07301607131958007, + "mean_token_accuracy": 0.9745715200901032, + "num_tokens": 6907092.0, + "step": 2960 + }, + { + "epoch": 7.363636363636363, + "eval_entropy": 0.2612536767021168, + "eval_loss": 0.8116245269775391, + "eval_mean_token_accuracy": 0.8510967350976412, + "eval_num_tokens": 6907092.0, + "eval_runtime": 85.6373, + "eval_samples_per_second": 16.056, + "eval_steps_per_second": 2.008, + "step": 2960 + }, + { + "entropy": 0.1349492883309722, + "epoch": 7.4134495641344955, + "grad_norm": 0.24552719295024872, + "learning_rate": 4.315927466345791e-05, + "loss": 0.07397544980049134, + "mean_token_accuracy": 0.9745095103979111, + "num_tokens": 6952700.0, + "step": 2980 + }, + { + "epoch": 7.4134495641344955, + "eval_entropy": 0.25796533306670744, + "eval_loss": 0.8266491293907166, + "eval_mean_token_accuracy": 0.8511653857868772, + "eval_num_tokens": 6952700.0, + "eval_runtime": 85.7462, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.006, + "step": 2980 + }, + { + "entropy": 0.14479175000451505, + "epoch": 7.463262764632628, + "grad_norm": 0.2846072018146515, + "learning_rate": 4.162601439345814e-05, + "loss": 0.07544798254966736, + "mean_token_accuracy": 0.9727819666266442, + "num_tokens": 6996430.0, + "step": 3000 + }, + { + "epoch": 7.463262764632628, + "eval_entropy": 0.2584348309698493, + "eval_loss": 0.8253348469734192, + "eval_mean_token_accuracy": 0.8511569815319638, + "eval_num_tokens": 6996430.0, + "eval_runtime": 86.2984, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 3000 + }, + { + "entropy": 0.14114196319133043, + "epoch": 7.51307596513076, + "grad_norm": 0.407966285943985, + "learning_rate": 4.011432168422419e-05, + "loss": 0.0736398994922638, + "mean_token_accuracy": 0.9741654269397259, + "num_tokens": 7042038.0, + "step": 3020 + }, + { + "epoch": 7.51307596513076, + "eval_entropy": 0.25232676260693127, + "eval_loss": 0.8296052813529968, + "eval_mean_token_accuracy": 0.8523298349491385, + "eval_num_tokens": 7042038.0, + "eval_runtime": 85.8445, + "eval_samples_per_second": 16.017, + "eval_steps_per_second": 2.004, + "step": 3020 + }, + { + "entropy": 0.1353456223383546, + "epoch": 7.562889165628892, + "grad_norm": 0.2712634801864624, + "learning_rate": 3.8624652441658684e-05, + "loss": 0.07362412214279175, + "mean_token_accuracy": 0.9747945807874203, + "num_tokens": 7089390.0, + "step": 3040 + }, + { + "epoch": 7.562889165628892, + "eval_entropy": 0.2579477243991785, + "eval_loss": 0.8274564743041992, + "eval_mean_token_accuracy": 0.8517705212498821, + "eval_num_tokens": 7089390.0, + "eval_runtime": 85.8222, + "eval_samples_per_second": 16.022, + "eval_steps_per_second": 2.004, + "step": 3040 + }, + { + "entropy": 0.1296080862637609, + "epoch": 7.6127023661270234, + "grad_norm": 0.2371893972158432, + "learning_rate": 3.715745592968707e-05, + "loss": 0.06971035599708557, + "mean_token_accuracy": 0.9759043246507645, + "num_tokens": 7138002.0, + "step": 3060 + }, + { + "epoch": 7.6127023661270234, + "eval_entropy": 0.25391967083479083, + "eval_loss": 0.8197130560874939, + "eval_mean_token_accuracy": 0.8522267875283264, + "eval_num_tokens": 7138002.0, + "eval_runtime": 85.8796, + "eval_samples_per_second": 16.011, + "eval_steps_per_second": 2.003, + "step": 3060 + }, + { + "entropy": 0.1311203008517623, + "epoch": 7.662515566625156, + "grad_norm": 0.22499267756938934, + "learning_rate": 3.5713174634765967e-05, + "loss": 0.07176244258880615, + "mean_token_accuracy": 0.9754939571022987, + "num_tokens": 7185520.0, + "step": 3080 + }, + { + "epoch": 7.662515566625156, + "eval_entropy": 0.2526215241225653, + "eval_loss": 0.8265154361724854, + "eval_mean_token_accuracy": 0.8519952584837758, + "eval_num_tokens": 7185520.0, + "eval_runtime": 85.8746, + "eval_samples_per_second": 16.012, + "eval_steps_per_second": 2.003, + "step": 3080 + }, + { + "entropy": 0.13420484317466616, + "epoch": 7.712328767123288, + "grad_norm": 0.2398064285516739, + "learning_rate": 3.4292244132434866e-05, + "loss": 0.07559212446212768, + "mean_token_accuracy": 0.9743142127990723, + "num_tokens": 7232170.0, + "step": 3100 + }, + { + "epoch": 7.712328767123288, + "eval_entropy": 0.2484562756537005, + "eval_loss": 0.8312150239944458, + "eval_mean_token_accuracy": 0.8528405119513356, + "eval_num_tokens": 7232170.0, + "eval_runtime": 85.7896, + "eval_samples_per_second": 16.028, + "eval_steps_per_second": 2.005, + "step": 3100 + }, + { + "entropy": 0.11965563679113984, + "epoch": 7.76214196762142, + "grad_norm": 0.3408384919166565, + "learning_rate": 3.2895092955952746e-05, + "loss": 0.0661750853061676, + "mean_token_accuracy": 0.9776600524783134, + "num_tokens": 7282846.0, + "step": 3120 + }, + { + "epoch": 7.76214196762142, + "eval_entropy": 0.2522421533804993, + "eval_loss": 0.8327009677886963, + "eval_mean_token_accuracy": 0.8524222023958383, + "eval_num_tokens": 7282846.0, + "eval_runtime": 86.1769, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 1.996, + "step": 3120 + }, + { + "entropy": 0.13388084415346385, + "epoch": 7.811955168119551, + "grad_norm": 0.35418516397476196, + "learning_rate": 3.152214246705829e-05, + "loss": 0.07149899601936341, + "mean_token_accuracy": 0.9747635535895824, + "num_tokens": 7331518.0, + "step": 3140 + }, + { + "epoch": 7.811955168119551, + "eval_entropy": 0.25038352296795957, + "eval_loss": 0.836457371711731, + "eval_mean_token_accuracy": 0.8526130665180295, + "eval_num_tokens": 7331518.0, + "eval_runtime": 85.6099, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.009, + "step": 3140 + }, + { + "entropy": 0.13530643959529698, + "epoch": 7.861768368617684, + "grad_norm": 0.38060539960861206, + "learning_rate": 3.017380672889291e-05, + "loss": 0.07116585969924927, + "mean_token_accuracy": 0.973284512758255, + "num_tokens": 7379056.0, + "step": 3160 + }, + { + "epoch": 7.861768368617684, + "eval_entropy": 0.255092611319797, + "eval_loss": 0.8314701914787292, + "eval_mean_token_accuracy": 0.8520913099826768, + "eval_num_tokens": 7379056.0, + "eval_runtime": 85.877, + "eval_samples_per_second": 16.011, + "eval_steps_per_second": 2.003, + "step": 3160 + }, + { + "entropy": 0.13383390177041293, + "epoch": 7.911581569115816, + "grad_norm": 0.3827536106109619, + "learning_rate": 2.8850492381124808e-05, + "loss": 0.07305437326431274, + "mean_token_accuracy": 0.9750778004527092, + "num_tokens": 7424770.0, + "step": 3180 + }, + { + "epoch": 7.911581569115816, + "eval_entropy": 0.25416371157003004, + "eval_loss": 0.8206402063369751, + "eval_mean_token_accuracy": 0.852779901651449, + "eval_num_tokens": 7424770.0, + "eval_runtime": 86.1015, + "eval_samples_per_second": 15.97, + "eval_steps_per_second": 1.998, + "step": 3180 + }, + { + "entropy": 0.1395680439658463, + "epoch": 7.961394769613948, + "grad_norm": 0.3809775412082672, + "learning_rate": 2.7552598517312256e-05, + "loss": 0.07236042022705078, + "mean_token_accuracy": 0.9731538116931915, + "num_tokens": 7470804.0, + "step": 3200 + }, + { + "epoch": 7.961394769613948, + "eval_entropy": 0.25528111975899964, + "eval_loss": 0.8230037093162537, + "eval_mean_token_accuracy": 0.8526452603035195, + "eval_num_tokens": 7470804.0, + "eval_runtime": 85.7895, + "eval_samples_per_second": 16.028, + "eval_steps_per_second": 2.005, + "step": 3200 + }, + { + "entropy": 0.12193699864049752, + "epoch": 8.009962640099626, + "grad_norm": 0.11854425817728043, + "learning_rate": 2.6280516564542205e-05, + "loss": 0.06617764234542847, + "mean_token_accuracy": 0.977179691577569, + "num_tokens": 7518110.0, + "step": 3220 + }, + { + "epoch": 8.009962640099626, + "eval_entropy": 0.25100527677771656, + "eval_loss": 0.8393343687057495, + "eval_mean_token_accuracy": 0.8522553132023922, + "eval_num_tokens": 7518110.0, + "eval_runtime": 85.8837, + "eval_samples_per_second": 16.01, + "eval_steps_per_second": 2.003, + "step": 3220 + }, + { + "entropy": 0.12788885813206435, + "epoch": 8.059775840597759, + "grad_norm": 0.16094881296157837, + "learning_rate": 2.50346301653812e-05, + "loss": 0.06274186968803405, + "mean_token_accuracy": 0.9766994707286358, + "num_tokens": 7565539.0, + "step": 3240 + }, + { + "epoch": 8.059775840597759, + "eval_entropy": 0.24409458682287571, + "eval_loss": 0.874617338180542, + "eval_mean_token_accuracy": 0.8521041180505309, + "eval_num_tokens": 7565539.0, + "eval_runtime": 86.2656, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 3240 + }, + { + "entropy": 0.12464155335910618, + "epoch": 8.10958904109589, + "grad_norm": 0.16893954575061798, + "learning_rate": 2.381531506217437e-05, + "loss": 0.06093020439147949, + "mean_token_accuracy": 0.9776258453726768, + "num_tokens": 7612578.0, + "step": 3260 + }, + { + "epoch": 8.10958904109589, + "eval_entropy": 0.24396493017326953, + "eval_loss": 0.891161322593689, + "eval_mean_token_accuracy": 0.8515338024427724, + "eval_num_tokens": 7612578.0, + "eval_runtime": 85.9061, + "eval_samples_per_second": 16.006, + "eval_steps_per_second": 2.002, + "step": 3260 + }, + { + "entropy": 0.12345920228399336, + "epoch": 8.159402241594023, + "grad_norm": 0.14332273602485657, + "learning_rate": 2.262293898372616e-05, + "loss": 0.061289966106414795, + "mean_token_accuracy": 0.9762230902910233, + "num_tokens": 7660157.0, + "step": 3280 + }, + { + "epoch": 8.159402241594023, + "eval_entropy": 0.2481445314059424, + "eval_loss": 0.8922848105430603, + "eval_mean_token_accuracy": 0.8514944855556932, + "eval_num_tokens": 7660157.0, + "eval_runtime": 85.5201, + "eval_samples_per_second": 16.078, + "eval_steps_per_second": 2.011, + "step": 3280 + }, + { + "entropy": 0.12298110066913068, + "epoch": 8.209215442092155, + "grad_norm": 0.21848882734775543, + "learning_rate": 2.1457861534398633e-05, + "loss": 0.05986443758010864, + "mean_token_accuracy": 0.9786281704902648, + "num_tokens": 7709745.0, + "step": 3300 + }, + { + "epoch": 8.209215442092155, + "eval_entropy": 0.24329388124305149, + "eval_loss": 0.9021085500717163, + "eval_mean_token_accuracy": 0.8521762625422589, + "eval_num_tokens": 7709745.0, + "eval_runtime": 85.955, + "eval_samples_per_second": 15.997, + "eval_steps_per_second": 2.001, + "step": 3300 + }, + { + "entropy": 0.13265180448070168, + "epoch": 8.259028642590286, + "grad_norm": 0.18067947030067444, + "learning_rate": 2.0320434085659692e-05, + "loss": 0.06724961400032044, + "mean_token_accuracy": 0.975098168104887, + "num_tokens": 7753571.0, + "step": 3320 + }, + { + "epoch": 8.259028642590286, + "eval_entropy": 0.2433211464694766, + "eval_loss": 0.9094350337982178, + "eval_mean_token_accuracy": 0.8520150094531304, + "eval_num_tokens": 7753571.0, + "eval_runtime": 85.7989, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.005, + "step": 3320 + }, + { + "entropy": 0.11949320202693343, + "epoch": 8.308841843088418, + "grad_norm": 0.17020289599895477, + "learning_rate": 1.9210999670114196e-05, + "loss": 0.0634455680847168, + "mean_token_accuracy": 0.9771294385194779, + "num_tokens": 7799310.0, + "step": 3340 + }, + { + "epoch": 8.308841843088418, + "eval_entropy": 0.24345201219237128, + "eval_loss": 0.9021793603897095, + "eval_mean_token_accuracy": 0.8520745697409607, + "eval_num_tokens": 7799310.0, + "eval_runtime": 86.0883, + "eval_samples_per_second": 15.972, + "eval_steps_per_second": 1.998, + "step": 3340 + }, + { + "entropy": 0.12065747743472457, + "epoch": 8.35865504358655, + "grad_norm": 0.16789060831069946, + "learning_rate": 1.8129892878049886e-05, + "loss": 0.061494195461273195, + "mean_token_accuracy": 0.9779584899544715, + "num_tokens": 7846447.0, + "step": 3360 + }, + { + "epoch": 8.35865504358655, + "eval_entropy": 0.24093415042342142, + "eval_loss": 0.9006755352020264, + "eval_mean_token_accuracy": 0.852174230786257, + "eval_num_tokens": 7846447.0, + "eval_runtime": 85.9011, + "eval_samples_per_second": 16.007, + "eval_steps_per_second": 2.002, + "step": 3360 + }, + { + "entropy": 0.13125578537583352, + "epoch": 8.408468244084682, + "grad_norm": 0.1662452220916748, + "learning_rate": 1.70774397565298e-05, + "loss": 0.06685600876808166, + "mean_token_accuracy": 0.9744067586958408, + "num_tokens": 7890283.0, + "step": 3380 + }, + { + "epoch": 8.408468244084682, + "eval_entropy": 0.24062153688350388, + "eval_loss": 0.9078915119171143, + "eval_mean_token_accuracy": 0.8523201647886011, + "eval_num_tokens": 7890283.0, + "eval_runtime": 86.0201, + "eval_samples_per_second": 15.985, + "eval_steps_per_second": 2.0, + "step": 3380 + }, + { + "entropy": 0.11986117120832204, + "epoch": 8.458281444582815, + "grad_norm": 0.19571948051452637, + "learning_rate": 1.6053957711060606e-05, + "loss": 0.06411095261573792, + "mean_token_accuracy": 0.9770627245306969, + "num_tokens": 7936518.0, + "step": 3400 + }, + { + "epoch": 8.458281444582815, + "eval_entropy": 0.24352820347561394, + "eval_loss": 0.9058943390846252, + "eval_mean_token_accuracy": 0.8519382792156797, + "eval_num_tokens": 7936518.0, + "eval_runtime": 85.966, + "eval_samples_per_second": 15.995, + "eval_steps_per_second": 2.001, + "step": 3400 + }, + { + "entropy": 0.12857897616922856, + "epoch": 8.508094645080947, + "grad_norm": 0.2609264850616455, + "learning_rate": 1.5059755409867613e-05, + "loss": 0.06473397612571716, + "mean_token_accuracy": 0.9764650195837021, + "num_tokens": 7981966.0, + "step": 3420 + }, + { + "epoch": 8.508094645080947, + "eval_entropy": 0.24032609000108962, + "eval_loss": 0.9077776074409485, + "eval_mean_token_accuracy": 0.8517829197090726, + "eval_num_tokens": 7981966.0, + "eval_runtime": 86.6059, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 3420 + }, + { + "entropy": 0.12348870886489749, + "epoch": 8.557907845579079, + "grad_norm": 0.19537609815597534, + "learning_rate": 1.409513269080473e-05, + "loss": 0.06481348872184753, + "mean_token_accuracy": 0.9769559659063816, + "num_tokens": 8028367.0, + "step": 3440 + }, + { + "epoch": 8.557907845579079, + "eval_entropy": 0.2404322574824788, + "eval_loss": 0.9057720899581909, + "eval_mean_token_accuracy": 0.8521037981953732, + "eval_num_tokens": 8028367.0, + "eval_runtime": 86.166, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.996, + "step": 3440 + }, + { + "entropy": 0.12040232736617326, + "epoch": 8.607721046077211, + "grad_norm": 0.3310582935810089, + "learning_rate": 1.3160380470927183e-05, + "loss": 0.06468871235847473, + "mean_token_accuracy": 0.9768650442361831, + "num_tokens": 8074934.0, + "step": 3460 + }, + { + "epoch": 8.607721046077211, + "eval_entropy": 0.24118655876711356, + "eval_loss": 0.9028318524360657, + "eval_mean_token_accuracy": 0.8521025340224422, + "eval_num_tokens": 8074934.0, + "eval_runtime": 85.3668, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.015, + "step": 3460 + }, + { + "entropy": 0.12328103906475008, + "epoch": 8.657534246575342, + "grad_norm": 0.12836167216300964, + "learning_rate": 1.2255780658755122e-05, + "loss": 0.06229386329650879, + "mean_token_accuracy": 0.9763277888298034, + "num_tokens": 8122775.0, + "step": 3480 + }, + { + "epoch": 8.657534246575342, + "eval_entropy": 0.24194598145956217, + "eval_loss": 0.9009329080581665, + "eval_mean_token_accuracy": 0.8521693289973015, + "eval_num_tokens": 8122775.0, + "eval_runtime": 85.9415, + "eval_samples_per_second": 15.999, + "eval_steps_per_second": 2.001, + "step": 3480 + }, + { + "entropy": 0.11321646976284683, + "epoch": 8.707347447073474, + "grad_norm": 0.15656894445419312, + "learning_rate": 1.1381606069253786e-05, + "loss": 0.05908188819885254, + "mean_token_accuracy": 0.9779504477977753, + "num_tokens": 8174307.0, + "step": 3500 + }, + { + "epoch": 8.707347447073474, + "eval_entropy": 0.24121542517528977, + "eval_loss": 0.9016091823577881, + "eval_mean_token_accuracy": 0.8521790667328724, + "eval_num_tokens": 8174307.0, + "eval_runtime": 85.7465, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.006, + "step": 3500 + }, + { + "entropy": 0.12657046681270004, + "epoch": 8.757160647571606, + "grad_norm": 0.22597502171993256, + "learning_rate": 1.053812034155629e-05, + "loss": 0.06244581937789917, + "mean_token_accuracy": 0.976795207709074, + "num_tokens": 8222808.0, + "step": 3520 + }, + { + "epoch": 8.757160647571606, + "eval_entropy": 0.23877542708502258, + "eval_loss": 0.9069110155105591, + "eval_mean_token_accuracy": 0.8522880177858264, + "eval_num_tokens": 8222808.0, + "eval_runtime": 85.7792, + "eval_samples_per_second": 16.03, + "eval_steps_per_second": 2.005, + "step": 3520 + }, + { + "entropy": 0.11422101808711886, + "epoch": 8.806973848069738, + "grad_norm": 0.21139323711395264, + "learning_rate": 9.725577859453502e-06, + "loss": 0.05988085865974426, + "mean_token_accuracy": 0.9779510758817196, + "num_tokens": 8273335.0, + "step": 3540 + }, + { + "epoch": 8.806973848069738, + "eval_entropy": 0.2393161087881687, + "eval_loss": 0.9033801555633545, + "eval_mean_token_accuracy": 0.8522614209457885, + "eval_num_tokens": 8273335.0, + "eval_runtime": 85.5594, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 3540 + }, + { + "entropy": 0.13810604228638113, + "epoch": 8.85678704856787, + "grad_norm": 0.24571993947029114, + "learning_rate": 8.944223674675537e-06, + "loss": 0.07036117911338806, + "mean_token_accuracy": 0.9734892748296261, + "num_tokens": 8315235.0, + "step": 3560 + }, + { + "epoch": 8.85678704856787, + "eval_entropy": 0.23998506947658782, + "eval_loss": 0.9009848833084106, + "eval_mean_token_accuracy": 0.8521793619837872, + "eval_num_tokens": 8315235.0, + "eval_runtime": 86.0974, + "eval_samples_per_second": 15.97, + "eval_steps_per_second": 1.998, + "step": 3560 + }, + { + "entropy": 0.14193559321574867, + "epoch": 8.906600249066003, + "grad_norm": 0.17304112017154694, + "learning_rate": 8.194293432987386e-06, + "loss": 0.07077967524528503, + "mean_token_accuracy": 0.973305893689394, + "num_tokens": 8358099.0, + "step": 3580 + }, + { + "epoch": 8.906600249066003, + "eval_entropy": 0.23883876689644748, + "eval_loss": 0.9015622138977051, + "eval_mean_token_accuracy": 0.8524864378363587, + "eval_num_tokens": 8358099.0, + "eval_runtime": 86.0089, + "eval_samples_per_second": 15.987, + "eval_steps_per_second": 2.0, + "step": 3580 + }, + { + "entropy": 0.11878943420015275, + "epoch": 8.956413449564135, + "grad_norm": 0.19075658917427063, + "learning_rate": 7.476013303121426e-06, + "loss": 0.060806107521057126, + "mean_token_accuracy": 0.9776863709092141, + "num_tokens": 8407430.0, + "step": 3600 + }, + { + "epoch": 8.956413449564135, + "eval_entropy": 0.23726526309931, + "eval_loss": 0.9060276746749878, + "eval_mean_token_accuracy": 0.8524192058762838, + "eval_num_tokens": 8407430.0, + "eval_runtime": 85.7252, + "eval_samples_per_second": 16.04, + "eval_steps_per_second": 2.006, + "step": 3600 + }, + { + "entropy": 0.1255835090787747, + "epoch": 9.004981320049813, + "grad_norm": 0.11608047038316727, + "learning_rate": 6.78959990856799e-06, + "loss": 0.06319612860679627, + "mean_token_accuracy": 0.9766685519462976, + "num_tokens": 8453175.0, + "step": 3620 + }, + { + "epoch": 9.004981320049813, + "eval_entropy": 0.2373251837006835, + "eval_loss": 0.9045722484588623, + "eval_mean_token_accuracy": 0.8525558363559634, + "eval_num_tokens": 8453175.0, + "eval_runtime": 85.7435, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.006, + "step": 3620 + }, + { + "entropy": 0.12587778437882663, + "epoch": 9.054794520547945, + "grad_norm": 0.1564614623785019, + "learning_rate": 6.135260262244683e-06, + "loss": 0.0630365788936615, + "mean_token_accuracy": 0.9777486085891723, + "num_tokens": 8497151.0, + "step": 3640 + }, + { + "epoch": 9.054794520547945, + "eval_entropy": 0.23559923721260803, + "eval_loss": 0.9120694398880005, + "eval_mean_token_accuracy": 0.8525292966947999, + "eval_num_tokens": 8497151.0, + "eval_runtime": 85.8018, + "eval_samples_per_second": 16.025, + "eval_steps_per_second": 2.005, + "step": 3640 + }, + { + "entropy": 0.12535365503281354, + "epoch": 9.104607721046078, + "grad_norm": 0.1404249221086502, + "learning_rate": 5.513191704064086e-06, + "loss": 0.060502654314041136, + "mean_token_accuracy": 0.9770058333873749, + "num_tokens": 8542996.0, + "step": 3660 + }, + { + "epoch": 9.104607721046078, + "eval_entropy": 0.23525122691725575, + "eval_loss": 0.9182237982749939, + "eval_mean_token_accuracy": 0.8524098333924316, + "eval_num_tokens": 8542996.0, + "eval_runtime": 85.9872, + "eval_samples_per_second": 15.991, + "eval_steps_per_second": 2.0, + "step": 3660 + }, + { + "entropy": 0.11330419047735632, + "epoch": 9.15442092154421, + "grad_norm": 0.15513843297958374, + "learning_rate": 4.92358184141876e-06, + "loss": 0.05822383761405945, + "mean_token_accuracy": 0.9793384782969952, + "num_tokens": 8591625.0, + "step": 3680 + }, + { + "epoch": 9.15442092154421, + "eval_entropy": 0.2353947116711805, + "eval_loss": 0.9229223132133484, + "eval_mean_token_accuracy": 0.852500357253607, + "eval_num_tokens": 8591625.0, + "eval_runtime": 86.0805, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.998, + "step": 3680 + }, + { + "entropy": 0.11830627010203898, + "epoch": 9.204234122042342, + "grad_norm": 0.1730550080537796, + "learning_rate": 4.366608492601456e-06, + "loss": 0.05860854983329773, + "mean_token_accuracy": 0.9779663667082786, + "num_tokens": 8639845.0, + "step": 3700 + }, + { + "epoch": 9.204234122042342, + "eval_entropy": 0.23567205719476522, + "eval_loss": 0.9269373416900635, + "eval_mean_token_accuracy": 0.8523658004611038, + "eval_num_tokens": 8639845.0, + "eval_runtime": 85.9809, + "eval_samples_per_second": 15.992, + "eval_steps_per_second": 2.0, + "step": 3700 + }, + { + "entropy": 0.1180900705512613, + "epoch": 9.254047322540472, + "grad_norm": 0.20909737050533295, + "learning_rate": 3.842439633177387e-06, + "loss": 0.059438884258270264, + "mean_token_accuracy": 0.9786856278777123, + "num_tokens": 8687194.0, + "step": 3720 + }, + { + "epoch": 9.254047322540472, + "eval_entropy": 0.23602714493524196, + "eval_loss": 0.9293538928031921, + "eval_mean_token_accuracy": 0.8523273440294488, + "eval_num_tokens": 8687194.0, + "eval_runtime": 85.2118, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.019, + "step": 3720 + }, + { + "entropy": 0.13156692241318524, + "epoch": 9.303860523038605, + "grad_norm": 0.12535709142684937, + "learning_rate": 3.3512333453253305e-06, + "loss": 0.06337688565254211, + "mean_token_accuracy": 0.9756712593138218, + "num_tokens": 8731721.0, + "step": 3740 + }, + { + "epoch": 9.303860523038605, + "eval_entropy": 0.23534389351343, + "eval_loss": 0.932999312877655, + "eval_mean_token_accuracy": 0.8523333925147389, + "eval_num_tokens": 8731721.0, + "eval_runtime": 85.953, + "eval_samples_per_second": 15.997, + "eval_steps_per_second": 2.001, + "step": 3740 + }, + { + "entropy": 0.12327516414225101, + "epoch": 9.353673723536737, + "grad_norm": 0.16341575980186462, + "learning_rate": 2.8931377701619306e-06, + "loss": 0.05869622826576233, + "mean_token_accuracy": 0.9784224212169648, + "num_tokens": 8778614.0, + "step": 3760 + }, + { + "epoch": 9.353673723536737, + "eval_entropy": 0.23493653622477553, + "eval_loss": 0.9358566999435425, + "eval_mean_token_accuracy": 0.8522722783476807, + "eval_num_tokens": 8778614.0, + "eval_runtime": 85.2538, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.018, + "step": 3760 + }, + { + "entropy": 0.1134357453789562, + "epoch": 9.403486924034869, + "grad_norm": 0.23999616503715515, + "learning_rate": 2.4682910630645723e-06, + "loss": 0.057540220022201535, + "mean_token_accuracy": 0.9798057802021504, + "num_tokens": 8826551.0, + "step": 3780 + }, + { + "epoch": 9.403486924034869, + "eval_entropy": 0.23470525634150172, + "eval_loss": 0.937556266784668, + "eval_mean_token_accuracy": 0.8523351706044618, + "eval_num_tokens": 8826551.0, + "eval_runtime": 85.7764, + "eval_samples_per_second": 16.03, + "eval_steps_per_second": 2.005, + "step": 3780 + }, + { + "entropy": 0.1075570048764348, + "epoch": 9.453300124533001, + "grad_norm": 0.15417765080928802, + "learning_rate": 2.0768213520055406e-06, + "loss": 0.05581026673316956, + "mean_token_accuracy": 0.9797527104616165, + "num_tokens": 8876556.0, + "step": 3800 + }, + { + "epoch": 9.453300124533001, + "eval_entropy": 0.2347462713545145, + "eval_loss": 0.9383137226104736, + "eval_mean_token_accuracy": 0.8522575324357942, + "eval_num_tokens": 8876556.0, + "eval_runtime": 85.8985, + "eval_samples_per_second": 16.007, + "eval_steps_per_second": 2.002, + "step": 3800 + }, + { + "entropy": 0.12609313456341625, + "epoch": 9.503113325031133, + "grad_norm": 0.22041426599025726, + "learning_rate": 1.7188466989102739e-06, + "loss": 0.06379218697547913, + "mean_token_accuracy": 0.9763593293726445, + "num_tokens": 8920286.0, + "step": 3820 + }, + { + "epoch": 9.503113325031133, + "eval_entropy": 0.23459658849724505, + "eval_loss": 0.9393337965011597, + "eval_mean_token_accuracy": 0.8523633532052817, + "eval_num_tokens": 8920286.0, + "eval_runtime": 85.9348, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.002, + "step": 3820 + }, + { + "entropy": 0.12149709439836442, + "epoch": 9.552926525529266, + "grad_norm": 0.16608643531799316, + "learning_rate": 1.3944750640516357e-06, + "loss": 0.06341606974601746, + "mean_token_accuracy": 0.9771503552794456, + "num_tokens": 8964464.0, + "step": 3840 + }, + { + "epoch": 9.552926525529266, + "eval_entropy": 0.2347291322468325, + "eval_loss": 0.9399036765098572, + "eval_mean_token_accuracy": 0.8523768914300341, + "eval_num_tokens": 8964464.0, + "eval_runtime": 86.1305, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.997, + "step": 3840 + }, + { + "entropy": 0.11724846777506173, + "epoch": 9.602739726027398, + "grad_norm": 0.13613300025463104, + "learning_rate": 1.103804273490497e-06, + "loss": 0.05994418263435364, + "mean_token_accuracy": 0.9778759330511093, + "num_tokens": 9010414.0, + "step": 3860 + }, + { + "epoch": 9.602739726027398, + "eval_entropy": 0.23495923337894817, + "eval_loss": 0.9400841593742371, + "eval_mean_token_accuracy": 0.8523780471363733, + "eval_num_tokens": 9010414.0, + "eval_runtime": 86.0379, + "eval_samples_per_second": 15.981, + "eval_steps_per_second": 1.999, + "step": 3860 + }, + { + "entropy": 0.12054574331268668, + "epoch": 9.65255292652553, + "grad_norm": 0.11884245276451111, + "learning_rate": 8.469219895727582e-07, + "loss": 0.05917409062385559, + "mean_token_accuracy": 0.9771256923675538, + "num_tokens": 9058053.0, + "step": 3880 + }, + { + "epoch": 9.65255292652553, + "eval_entropy": 0.23499552723626757, + "eval_loss": 0.9404177665710449, + "eval_mean_token_accuracy": 0.8523571678372317, + "eval_num_tokens": 9058053.0, + "eval_runtime": 86.0174, + "eval_samples_per_second": 15.985, + "eval_steps_per_second": 2.0, + "step": 3880 + }, + { + "entropy": 0.12163264504633844, + "epoch": 9.70236612702366, + "grad_norm": 0.18393972516059875, + "learning_rate": 6.239056844915407e-07, + "loss": 0.059613007307052615, + "mean_token_accuracy": 0.9776720523834228, + "num_tokens": 9105574.0, + "step": 3900 + }, + { + "epoch": 9.70236612702366, + "eval_entropy": 0.23491846319547918, + "eval_loss": 0.9405836462974548, + "eval_mean_token_accuracy": 0.8523543633000795, + "eval_num_tokens": 9105574.0, + "eval_runtime": 85.9519, + "eval_samples_per_second": 15.997, + "eval_steps_per_second": 2.001, + "step": 3900 + }, + { + "entropy": 0.11569633753970265, + "epoch": 9.752179327521793, + "grad_norm": 0.1553788185119629, + "learning_rate": 4.3482261692267186e-07, + "loss": 0.05866732001304627, + "mean_token_accuracy": 0.9790047742426395, + "num_tokens": 9152793.0, + "step": 3920 + }, + { + "epoch": 9.752179327521793, + "eval_entropy": 0.23489533165513082, + "eval_loss": 0.9410145878791809, + "eval_mean_token_accuracy": 0.8524025068726651, + "eval_num_tokens": 9152793.0, + "eval_runtime": 85.5221, + "eval_samples_per_second": 16.078, + "eval_steps_per_second": 2.011, + "step": 3920 + }, + { + "entropy": 0.12030278495512903, + "epoch": 9.801992528019925, + "grad_norm": 0.20454250276088715, + "learning_rate": 2.797298117403634e-07, + "loss": 0.061210107803344724, + "mean_token_accuracy": 0.9774218738079071, + "num_tokens": 9199382.0, + "step": 3940 + }, + { + "epoch": 9.801992528019925, + "eval_entropy": 0.2348609700105911, + "eval_loss": 0.9410302639007568, + "eval_mean_token_accuracy": 0.8523409498292346, + "eval_num_tokens": 9199382.0, + "eval_runtime": 85.9105, + "eval_samples_per_second": 16.005, + "eval_steps_per_second": 2.002, + "step": 3940 + }, + { + "entropy": 0.11162231937050819, + "epoch": 9.851805728518057, + "grad_norm": 0.13079790771007538, + "learning_rate": 1.5867404281932237e-07, + "loss": 0.05349419116973877, + "mean_token_accuracy": 0.9791230395436287, + "num_tokens": 9251912.0, + "step": 3960 + }, + { + "epoch": 9.851805728518057, + "eval_entropy": 0.23484029950097549, + "eval_loss": 0.9411523342132568, + "eval_mean_token_accuracy": 0.8523351938225502, + "eval_num_tokens": 9251912.0, + "eval_runtime": 85.1298, + "eval_samples_per_second": 16.152, + "eval_steps_per_second": 2.02, + "step": 3960 + }, + { + "entropy": 0.12446248792111873, + "epoch": 9.90161892901619, + "grad_norm": 0.1705058217048645, + "learning_rate": 7.16918189283218e-08, + "loss": 0.061916273832321164, + "mean_token_accuracy": 0.9767685994505882, + "num_tokens": 9296482.0, + "step": 3980 + }, + { + "epoch": 9.90161892901619, + "eval_entropy": 0.2347967088395773, + "eval_loss": 0.9411665201187134, + "eval_mean_token_accuracy": 0.8524297087691551, + "eval_num_tokens": 9296482.0, + "eval_runtime": 86.2026, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 3980 + }, + { + "entropy": 0.13053828622214497, + "epoch": 9.951432129514322, + "grad_norm": 0.1882583051919937, + "learning_rate": 1.8809372719714117e-08, + "loss": 0.06384563446044922, + "mean_token_accuracy": 0.9753879077732563, + "num_tokens": 9341118.0, + "step": 4000 + }, + { + "epoch": 9.951432129514322, + "eval_entropy": 0.23490050339768098, + "eval_loss": 0.9411982297897339, + "eval_mean_token_accuracy": 0.8522821709860203, + "eval_num_tokens": 9341118.0, + "eval_runtime": 86.5264, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 4000 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.9449716498034074e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4020/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4020/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4020/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4020/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4020/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4020/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4020/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4020/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4020/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4020/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4020/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4020/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4020/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4020/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..bf9c6ce757e6c7dbed95225046881d1beb8ca4cb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4020/trainer_state.json @@ -0,0 +1,4255 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 10.0, + "eval_steps": 20, + "global_step": 4020, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + }, + { + "entropy": 0.561330484598875, + "epoch": 1.891656288916563, + "grad_norm": 0.6722865700721741, + "learning_rate": 0.0002208867897174789, + "loss": 0.499837589263916, + "mean_token_accuracy": 0.8518734864890576, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.5865232653396074, + "eval_loss": 0.5437926650047302, + "eval_mean_token_accuracy": 0.8450997017843779, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4116, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.547389242425561, + "epoch": 1.9414694894146949, + "grad_norm": 0.7935577034950256, + "learning_rate": 0.00022027119820226907, + "loss": 0.4977591514587402, + "mean_token_accuracy": 0.8539491161704064, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.5290903090391048, + "eval_loss": 0.5409526824951172, + "eval_mean_token_accuracy": 0.8497545698354411, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.7262, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 780 + }, + { + "entropy": 0.5687909748405218, + "epoch": 1.9912826899128269, + "grad_norm": 0.6180546283721924, + "learning_rate": 0.00021962329729698345, + "loss": 0.5109643459320068, + "mean_token_accuracy": 0.8521598495543004, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.5503541858390321, + "eval_loss": 0.5361555218696594, + "eval_mean_token_accuracy": 0.8510884285666221, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.3339, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 800 + }, + { + "entropy": 0.4739728841261986, + "epoch": 2.0398505603985058, + "grad_norm": 0.8058829307556152, + "learning_rate": 0.0002189432823996982, + "loss": 0.4204097747802734, + "mean_token_accuracy": 0.8728981889211215, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.5077334992414297, + "eval_loss": 0.5531114339828491, + "eval_mean_token_accuracy": 0.8489257208136625, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.4801, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.989, + "step": 820 + }, + { + "entropy": 0.4594309840351343, + "epoch": 2.0896637608966375, + "grad_norm": 0.6906896829605103, + "learning_rate": 0.0002182313585936314, + "loss": 0.4071959495544434, + "mean_token_accuracy": 0.8732857562601566, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.49850136994622474, + "eval_loss": 0.5486204624176025, + "eval_mean_token_accuracy": 0.8507991450470548, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.3364, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.4881629109382629, + "epoch": 2.1394769613947697, + "grad_norm": 0.6343470215797424, + "learning_rate": 0.0002174877405852928, + "loss": 0.41669540405273436, + "mean_token_accuracy": 0.8711295068264008, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.49155513924914734, + "eval_loss": 0.555109441280365, + "eval_mean_token_accuracy": 0.8496399400539176, + "eval_num_tokens": 2008562.0, + "eval_runtime": 86.3295, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 860 + }, + { + "entropy": 0.4648668970912695, + "epoch": 2.1892901618929015, + "grad_norm": 0.8014165163040161, + "learning_rate": 0.00021671265263973133, + "loss": 0.4110250473022461, + "mean_token_accuracy": 0.8754166305065155, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.4909258722219356, + "eval_loss": 0.5539511442184448, + "eval_mean_token_accuracy": 0.8492401502160138, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.3468, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 880 + }, + { + "entropy": 0.4824485514312983, + "epoch": 2.2391033623910337, + "grad_norm": 0.6665191054344177, + "learning_rate": 0.00021590632851289967, + "loss": 0.4181404113769531, + "mean_token_accuracy": 0.8726993151009083, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.4986876940657926, + "eval_loss": 0.547695517539978, + "eval_mean_token_accuracy": 0.8501384708770486, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.3838, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 900 + }, + { + "entropy": 0.4751896943897009, + "epoch": 2.2889165628891655, + "grad_norm": 0.81158047914505, + "learning_rate": 0.00021506901138115678, + "loss": 0.40689678192138673, + "mean_token_accuracy": 0.8745221219956875, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.507153491121392, + "eval_loss": 0.5501641631126404, + "eval_mean_token_accuracy": 0.8495670116918032, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.0912, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 920 + }, + { + "entropy": 0.4873133715242147, + "epoch": 2.3387297633872977, + "grad_norm": 0.7218056321144104, + "learning_rate": 0.0002142009537679292, + "loss": 0.42701358795166017, + "mean_token_accuracy": 0.8695114746689796, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5202612736543943, + "eval_loss": 0.5491839051246643, + "eval_mean_token_accuracy": 0.8494071208460386, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.1142, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 940 + }, + { + "entropy": 0.4762951169162989, + "epoch": 2.3885429638854294, + "grad_norm": 0.7194424867630005, + "learning_rate": 0.0002133024174675534, + "loss": 0.42299847602844237, + "mean_token_accuracy": 0.8709790132939815, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4899340462546016, + "eval_loss": 0.5522511601448059, + "eval_mean_token_accuracy": 0.8492208258357159, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.463, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 960 + }, + { + "entropy": 0.49650347977876663, + "epoch": 2.4383561643835616, + "grad_norm": 0.8406022787094116, + "learning_rate": 0.0002123736734663221, + "loss": 0.4275330066680908, + "mean_token_accuracy": 0.8670595556497573, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.49691385654515996, + "eval_loss": 0.5491269826889038, + "eval_mean_token_accuracy": 0.850309816210769, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.17, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 980 + }, + { + "entropy": 0.48843890577554705, + "epoch": 2.488169364881694, + "grad_norm": 0.9082473516464233, + "learning_rate": 0.00021141500186075868, + "loss": 0.4309722423553467, + "mean_token_accuracy": 0.8686766296625137, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5543508351195691, + "eval_loss": 0.5478800535202026, + "eval_mean_token_accuracy": 0.8478029522784921, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.3835, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 1000 + }, + { + "entropy": 0.4777219031006098, + "epoch": 2.5379825653798256, + "grad_norm": 0.7448089122772217, + "learning_rate": 0.0002104266917731438, + "loss": 0.423325252532959, + "mean_token_accuracy": 0.8706337086856365, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.49857561550168106, + "eval_loss": 0.5511948466300964, + "eval_mean_token_accuracy": 0.8502220289651737, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.5399, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.988, + "step": 1020 + }, + { + "entropy": 0.4844174191355705, + "epoch": 2.587795765877958, + "grad_norm": 0.794029176235199, + "learning_rate": 0.00020940904126432, + "loss": 0.4176753044128418, + "mean_token_accuracy": 0.873535567522049, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.485467542222766, + "eval_loss": 0.5539286732673645, + "eval_mean_token_accuracy": 0.8495475081510322, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.135, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 1.997, + "step": 1040 + }, + { + "entropy": 0.49070929251611234, + "epoch": 2.6376089663760895, + "grad_norm": 0.7558256983757019, + "learning_rate": 0.0002083623572438007, + "loss": 0.42867293357849123, + "mean_token_accuracy": 0.8696666076779366, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.490822730889154, + "eval_loss": 0.5434785485267639, + "eval_mean_token_accuracy": 0.850568296950917, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.4933, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 1060 + }, + { + "entropy": 0.47806114703416824, + "epoch": 2.6874221668742218, + "grad_norm": 0.6608979105949402, + "learning_rate": 0.00020728695537721047, + "loss": 0.4289727687835693, + "mean_token_accuracy": 0.8693130135536193, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.5285773256490397, + "eval_loss": 0.5444230437278748, + "eval_mean_token_accuracy": 0.8498796481032704, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.7091, + "eval_samples_per_second": 15.858, + "eval_steps_per_second": 1.984, + "step": 1080 + }, + { + "entropy": 0.5046216730028391, + "epoch": 2.7372353673723535, + "grad_norm": 0.8428544998168945, + "learning_rate": 0.00020618315999108454, + "loss": 0.43131070137023925, + "mean_token_accuracy": 0.8701941035687923, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.49888394738352576, + "eval_loss": 0.5459766387939453, + "eval_mean_token_accuracy": 0.8511758872935938, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.2222, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.995, + "step": 1100 + }, + { + "entropy": 0.5212558470666409, + "epoch": 2.7870485678704857, + "grad_norm": 1.129318118095398, + "learning_rate": 0.00020505130397505635, + "loss": 0.44249300956726073, + "mean_token_accuracy": 0.8654101334512234, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5179622324053631, + "eval_loss": 0.5522801280021667, + "eval_mean_token_accuracy": 0.8497019947268242, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.1903, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.996, + "step": 1120 + }, + { + "entropy": 0.4988406613469124, + "epoch": 2.8368617683686175, + "grad_norm": 0.6460545063018799, + "learning_rate": 0.00020389172868146263, + "loss": 0.4386270523071289, + "mean_token_accuracy": 0.8690383620560169, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.5042278484203094, + "eval_loss": 0.5433034300804138, + "eval_mean_token_accuracy": 0.8497674451317898, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.3028, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.993, + "step": 1140 + }, + { + "entropy": 0.4926559619605541, + "epoch": 2.8866749688667497, + "grad_norm": 0.8199329972267151, + "learning_rate": 0.00020270478382239615, + "loss": 0.4313485145568848, + "mean_token_accuracy": 0.8674727231264114, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.503873193160046, + "eval_loss": 0.5388111472129822, + "eval_mean_token_accuracy": 0.8526195034731266, + "eval_num_tokens": 2710196.0, + "eval_runtime": 86.4054, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.991, + "step": 1160 + }, + { + "entropy": 0.5020013231784105, + "epoch": 2.936488169364882, + "grad_norm": 0.7344821095466614, + "learning_rate": 0.00020149082736423723, + "loss": 0.43590536117553713, + "mean_token_accuracy": 0.8671772189438343, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5368241809828337, + "eval_loss": 0.5355703830718994, + "eval_mean_token_accuracy": 0.8517617773871089, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.2945, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1180 + }, + { + "entropy": 0.5112275708466768, + "epoch": 2.9863013698630136, + "grad_norm": 0.6951606869697571, + "learning_rate": 0.00020025022541969622, + "loss": 0.43579301834106443, + "mean_token_accuracy": 0.8641206480562686, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.5066795706055885, + "eval_loss": 0.5415249466896057, + "eval_mean_token_accuracy": 0.8493563373421513, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.5005, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.988, + "step": 1200 + }, + { + "entropy": 0.42298635305502474, + "epoch": 3.0348692403486925, + "grad_norm": 0.8201794028282166, + "learning_rate": 0.00019898335213739863, + "loss": 0.35593905448913576, + "mean_token_accuracy": 0.889238600547497, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.4584170470750609, + "eval_loss": 0.569487452507019, + "eval_mean_token_accuracy": 0.8495814173027526, + "eval_num_tokens": 2848509.0, + "eval_runtime": 86.2281, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 1220 + }, + { + "entropy": 0.37450140453875064, + "epoch": 3.0846824408468243, + "grad_norm": 0.7308394908905029, + "learning_rate": 0.0001976905895890471, + "loss": 0.307823920249939, + "mean_token_accuracy": 0.9001288741827012, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.45185995916294497, + "eval_loss": 0.5672881603240967, + "eval_mean_token_accuracy": 0.8511318519364955, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.0819, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.998, + "step": 1240 + }, + { + "entropy": 0.3887945845723152, + "epoch": 3.1344956413449565, + "grad_norm": 0.7299330830574036, + "learning_rate": 0.0001963723276541939, + "loss": 0.32047903537750244, + "mean_token_accuracy": 0.8960984498262405, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.44865354549053105, + "eval_loss": 0.5666037201881409, + "eval_mean_token_accuracy": 0.8496572649063066, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 1260 + }, + { + "entropy": 0.39677664265036583, + "epoch": 3.1843088418430883, + "grad_norm": 0.9533219933509827, + "learning_rate": 0.00019502896390265838, + "loss": 0.3253983497619629, + "mean_token_accuracy": 0.8964207418262958, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.4641980809527774, + "eval_loss": 0.5814996957778931, + "eval_mean_token_accuracy": 0.8485886212005171, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.7784, + "eval_samples_per_second": 15.845, + "eval_steps_per_second": 1.982, + "step": 1280 + }, + { + "entropy": 0.39210722744464876, + "epoch": 3.2341220423412205, + "grad_norm": 0.7447651028633118, + "learning_rate": 0.00019366090347462545, + "loss": 0.3276803970336914, + "mean_token_accuracy": 0.8930055953562259, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43595615254585135, + "eval_loss": 0.5722188353538513, + "eval_mean_token_accuracy": 0.8501105755567551, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.5271, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 1300 + }, + { + "entropy": 0.3684127271175385, + "epoch": 3.2839352428393527, + "grad_norm": 0.6934201121330261, + "learning_rate": 0.00019226855895846078, + "loss": 0.3156379222869873, + "mean_token_accuracy": 0.8976306475698947, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.4628148723480313, + "eval_loss": 0.5631352066993713, + "eval_mean_token_accuracy": 0.8504934813394103, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.3436, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 1320 + }, + { + "entropy": 0.4073401909321547, + "epoch": 3.3337484433374844, + "grad_norm": 0.9386897683143616, + "learning_rate": 0.00019085235026627994, + "loss": 0.34265310764312745, + "mean_token_accuracy": 0.8902062118053437, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.46455050623694133, + "eval_loss": 0.5586736798286438, + "eval_mean_token_accuracy": 0.8506874702004499, + "eval_num_tokens": 3132874.0, + "eval_runtime": 86.1286, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.997, + "step": 1340 + }, + { + "entropy": 0.4046429242938757, + "epoch": 3.383561643835616, + "grad_norm": 0.9633992314338684, + "learning_rate": 0.00018941270450730836, + "loss": 0.33816893100738527, + "mean_token_accuracy": 0.8927541889250279, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.46846531660750856, + "eval_loss": 0.561501681804657, + "eval_mean_token_accuracy": 0.8496256377114806, + "eval_num_tokens": 3178055.0, + "eval_runtime": 86.685, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1360 + }, + { + "entropy": 0.39872407019138334, + "epoch": 3.4333748443337484, + "grad_norm": 0.7786458730697632, + "learning_rate": 0.00018795005585907113, + "loss": 0.33342490196228025, + "mean_token_accuracy": 0.8944805048406124, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.42709505973860273, + "eval_loss": 0.5751848220825195, + "eval_mean_token_accuracy": 0.8507290447867194, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.6892, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 1380 + }, + { + "entropy": 0.3923338124528527, + "epoch": 3.4831880448318806, + "grad_norm": 0.9305956363677979, + "learning_rate": 0.0001864648454364511, + "loss": 0.33188116550445557, + "mean_token_accuracy": 0.8943330392241478, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.4386174779298694, + "eval_loss": 0.5680831074714661, + "eval_mean_token_accuracy": 0.8513129727784977, + "eval_num_tokens": 3274096.0, + "eval_runtime": 86.2671, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 1400 + }, + { + "entropy": 0.3856233984231949, + "epoch": 3.5330012453300124, + "grad_norm": 1.0362752676010132, + "learning_rate": 0.0001849575211586545, + "loss": 0.33098697662353516, + "mean_token_accuracy": 0.8961390435695649, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4574795474493226, + "eval_loss": 0.5630439519882202, + "eval_mean_token_accuracy": 0.8520988873964133, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.6035, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 1420 + }, + { + "entropy": 0.39812871962785723, + "epoch": 3.5828144458281446, + "grad_norm": 0.7807195782661438, + "learning_rate": 0.0001834285376141247, + "loss": 0.3333771228790283, + "mean_token_accuracy": 0.8930827379226685, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.4556825893909432, + "eval_loss": 0.5689062476158142, + "eval_mean_token_accuracy": 0.8507103507601937, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.1606, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.996, + "step": 1440 + }, + { + "entropy": 0.4147744856774807, + "epoch": 3.6326276463262763, + "grad_norm": 0.6429352164268494, + "learning_rate": 0.00018187835592344443, + "loss": 0.3482560873031616, + "mean_token_accuracy": 0.8910200245678425, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.46600024540757023, + "eval_loss": 0.5609709024429321, + "eval_mean_token_accuracy": 0.8491220876227977, + "eval_num_tokens": 3415600.0, + "eval_runtime": 86.8039, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1460 + }, + { + "entropy": 0.40425071083009245, + "epoch": 3.6824408468244085, + "grad_norm": 0.8613698482513428, + "learning_rate": 0.0001803074436002682, + "loss": 0.342916464805603, + "mean_token_accuracy": 0.8916418336331844, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.43855057899342026, + "eval_loss": 0.5720968246459961, + "eval_mean_token_accuracy": 0.8500823641932288, + "eval_num_tokens": 3460471.0, + "eval_runtime": 86.6746, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1480 + }, + { + "entropy": 0.39465143866837027, + "epoch": 3.7322540473225407, + "grad_norm": 0.6285189986228943, + "learning_rate": 0.0001787162744103265, + "loss": 0.3424591779708862, + "mean_token_accuracy": 0.8906558901071548, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4509461877304454, + "eval_loss": 0.5590082406997681, + "eval_mean_token_accuracy": 0.8511747371318729, + "eval_num_tokens": 3507647.0, + "eval_runtime": 86.8126, + "eval_samples_per_second": 15.839, + "eval_steps_per_second": 1.981, + "step": 1500 + }, + { + "entropy": 0.4021005939692259, + "epoch": 3.7820672478206725, + "grad_norm": 0.8821248412132263, + "learning_rate": 0.00017710532822854468, + "loss": 0.3462103843688965, + "mean_token_accuracy": 0.889109355956316, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.4502199075596277, + "eval_loss": 0.566046416759491, + "eval_mean_token_accuracy": 0.8501714208098345, + "eval_num_tokens": 3548934.0, + "eval_runtime": 86.8336, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.981, + "step": 1520 + }, + { + "entropy": 0.4017397932708263, + "epoch": 3.8318804483188043, + "grad_norm": 0.8400952816009521, + "learning_rate": 0.0001754750908943189, + "loss": 0.34890995025634763, + "mean_token_accuracy": 0.8892098367214203, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.4614003023435903, + "eval_loss": 0.5617933869361877, + "eval_mean_token_accuracy": 0.8515863616106122, + "eval_num_tokens": 3597186.0, + "eval_runtime": 86.4609, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 1540 + }, + { + "entropy": 0.4112051840871572, + "epoch": 3.8816936488169365, + "grad_norm": 0.769478440284729, + "learning_rate": 0.0001738260540649939, + "loss": 0.34711437225341796, + "mean_token_accuracy": 0.8911717928946018, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4540443811998811, + "eval_loss": 0.5576469898223877, + "eval_mean_token_accuracy": 0.8512079674144124, + "eval_num_tokens": 3646646.0, + "eval_runtime": 86.5103, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 1560 + }, + { + "entropy": 0.41105241514742374, + "epoch": 3.9315068493150687, + "grad_norm": 0.8468427062034607, + "learning_rate": 0.00017215871506758568, + "loss": 0.3433023452758789, + "mean_token_accuracy": 0.8898739732801915, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.4707539707075718, + "eval_loss": 0.5641466379165649, + "eval_mean_token_accuracy": 0.8495440957851188, + "eval_num_tokens": 3689560.0, + "eval_runtime": 86.609, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.986, + "step": 1580 + }, + { + "entropy": 0.41016379147768023, + "epoch": 3.9813200498132004, + "grad_norm": 0.7482675313949585, + "learning_rate": 0.0001704735767487946, + "loss": 0.34550890922546384, + "mean_token_accuracy": 0.8893028847873211, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.46391099864660307, + "eval_loss": 0.5593640804290771, + "eval_mean_token_accuracy": 0.8510130581467651, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.3975, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 1600 + }, + { + "entropy": 0.33167599791135544, + "epoch": 4.029887920298879, + "grad_norm": 0.9435692429542542, + "learning_rate": 0.00016877114732335337, + "loss": 0.2716026544570923, + "mean_token_accuracy": 0.9133149828666296, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.38499350005457567, + "eval_loss": 0.6298249363899231, + "eval_mean_token_accuracy": 0.8488117071778275, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.2933, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1620 + }, + { + "entropy": 0.3000166634097695, + "epoch": 4.0797011207970115, + "grad_norm": 0.8080845475196838, + "learning_rate": 0.0001670519402207569, + "loss": 0.22617182731628419, + "mean_token_accuracy": 0.9253474645316601, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.370110988703578, + "eval_loss": 0.6338461637496948, + "eval_mean_token_accuracy": 0.8485634801692741, + "eval_num_tokens": 3828830.0, + "eval_runtime": 85.9508, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.001, + "step": 1640 + }, + { + "entropy": 0.2986910421401262, + "epoch": 4.129514321295143, + "grad_norm": 0.7310900092124939, + "learning_rate": 0.0001653164739304185, + "loss": 0.22367463111877442, + "mean_token_accuracy": 0.9252275295555592, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.3944379702037157, + "eval_loss": 0.6109381914138794, + "eval_mean_token_accuracy": 0.849291454220927, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.6728, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1660 + }, + { + "entropy": 0.3095553796738386, + "epoch": 4.179327521793275, + "grad_norm": 0.7059140801429749, + "learning_rate": 0.0001635652718453007, + "loss": 0.23651680946350098, + "mean_token_accuracy": 0.9208931416273117, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.3910588648949945, + "eval_loss": 0.6104469299316406, + "eval_mean_token_accuracy": 0.8486883893262508, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7612, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.982, + "step": 1680 + }, + { + "entropy": 0.3001101028174162, + "epoch": 4.229140722291407, + "grad_norm": 0.6787802577018738, + "learning_rate": 0.00016179886210406728, + "loss": 0.23130471706390382, + "mean_token_accuracy": 0.9233332790434361, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3794369170832079, + "eval_loss": 0.6182110905647278, + "eval_mean_token_accuracy": 0.8495433777570724, + "eval_num_tokens": 3967474.0, + "eval_runtime": 85.94, + "eval_samples_per_second": 16.0, + "eval_steps_per_second": 2.001, + "step": 1700 + }, + { + "entropy": 0.3031421799212694, + "epoch": 4.2789539227895395, + "grad_norm": 0.9732038378715515, + "learning_rate": 0.0001600177774318036, + "loss": 0.2359529733657837, + "mean_token_accuracy": 0.9217648565769195, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3923123094231583, + "eval_loss": 0.6057384610176086, + "eval_mean_token_accuracy": 0.8508818288182103, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7647, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.29365369994193313, + "epoch": 4.328767123287671, + "grad_norm": 0.7681498527526855, + "learning_rate": 0.0001582225549793541, + "loss": 0.2269371747970581, + "mean_token_accuracy": 0.9245341829955578, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.4011661055129628, + "eval_loss": 0.6144486665725708, + "eval_mean_token_accuracy": 0.8480324357054955, + "eval_num_tokens": 4062594.0, + "eval_runtime": 87.1306, + "eval_samples_per_second": 15.781, + "eval_steps_per_second": 1.974, + "step": 1740 + }, + { + "entropy": 0.29396994728595016, + "epoch": 4.378580323785803, + "grad_norm": 1.0001007318496704, + "learning_rate": 0.0001564137361613248, + "loss": 0.22777395248413085, + "mean_token_accuracy": 0.9262309700250626, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38518730195802314, + "eval_loss": 0.6202630400657654, + "eval_mean_token_accuracy": 0.8493869807137999, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6616, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.3096018506214023, + "epoch": 4.428393524283935, + "grad_norm": 1.0448365211486816, + "learning_rate": 0.00015459186649280024, + "loss": 0.23696351051330566, + "mean_token_accuracy": 0.9217322513461113, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.3946371126140273, + "eval_loss": 0.6079026460647583, + "eval_mean_token_accuracy": 0.8492515852978063, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6582, + "eval_samples_per_second": 15.867, + "eval_steps_per_second": 1.985, + "step": 1780 + }, + { + "entropy": 0.32619857545942066, + "epoch": 4.478206724782067, + "grad_norm": 0.7210651636123657, + "learning_rate": 0.00015275749542482337, + "loss": 0.24651215076446534, + "mean_token_accuracy": 0.9177676141262054, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.3947690814560236, + "eval_loss": 0.6065912246704102, + "eval_mean_token_accuracy": 0.8502957744653835, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.5959, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.986, + "step": 1800 + }, + { + "entropy": 0.3193941755220294, + "epoch": 4.5280199252802, + "grad_norm": 0.8281906843185425, + "learning_rate": 0.0001509111761786888, + "loss": 0.23936262130737304, + "mean_token_accuracy": 0.9201708927750587, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38704028864239537, + "eval_loss": 0.6006569266319275, + "eval_mean_token_accuracy": 0.8502406720505205, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.8059, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1820 + }, + { + "entropy": 0.3164879363030195, + "epoch": 4.577833125778331, + "grad_norm": 0.7892968654632568, + "learning_rate": 0.00014905346557909867, + "loss": 0.24541733264923096, + "mean_token_accuracy": 0.9175932116806507, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.38861122120951497, + "eval_loss": 0.6115967631340027, + "eval_mean_token_accuracy": 0.849471275196519, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.2946, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1840 + }, + { + "entropy": 0.3051785985007882, + "epoch": 4.627646326276463, + "grad_norm": 0.8109654188156128, + "learning_rate": 0.0001471849238862319, + "loss": 0.23433220386505127, + "mean_token_accuracy": 0.9206570319831371, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.37162452295076015, + "eval_loss": 0.6184061765670776, + "eval_mean_token_accuracy": 0.8501173268223918, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.6865, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1860 + }, + { + "entropy": 0.3168198253959417, + "epoch": 4.677459526774595, + "grad_norm": 0.9512342214584351, + "learning_rate": 0.0001453061146267775, + "loss": 0.23832404613494873, + "mean_token_accuracy": 0.9197044663131237, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3845940856912801, + "eval_loss": 0.606762707233429, + "eval_mean_token_accuracy": 0.8504838194957999, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.5175, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 1880 + }, + { + "entropy": 0.30791807882487776, + "epoch": 4.7272727272727275, + "grad_norm": 0.8123113512992859, + "learning_rate": 0.00014341760442398248, + "loss": 0.2395785331726074, + "mean_token_accuracy": 0.918928150832653, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.39762327222283494, + "eval_loss": 0.5994202494621277, + "eval_mean_token_accuracy": 0.8509274201337681, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.2873, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.993, + "step": 1900 + }, + { + "entropy": 0.3021434534341097, + "epoch": 4.777085927770859, + "grad_norm": 0.731787383556366, + "learning_rate": 0.000141519962826766, + "loss": 0.23494718074798585, + "mean_token_accuracy": 0.9201403826475143, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.3827026732439219, + "eval_loss": 0.5995895862579346, + "eval_mean_token_accuracy": 0.851468373523202, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.3006, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 1920 + }, + { + "entropy": 0.31626159623265265, + "epoch": 4.826899128268991, + "grad_norm": 0.8848487138748169, + "learning_rate": 0.00013961376213795132, + "loss": 0.2439030647277832, + "mean_token_accuracy": 0.9196575872600079, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.388698436839636, + "eval_loss": 0.6000174283981323, + "eval_mean_token_accuracy": 0.8518068187458571, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.8979, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.979, + "step": 1940 + }, + { + "entropy": 0.30520407035946845, + "epoch": 4.876712328767123, + "grad_norm": 0.8532460927963257, + "learning_rate": 0.00013769957724166695, + "loss": 0.23458616733551024, + "mean_token_accuracy": 0.9221912942826748, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.38777847102908203, + "eval_loss": 0.6004981398582458, + "eval_mean_token_accuracy": 0.8516481768253238, + "eval_num_tokens": 4578167.0, + "eval_runtime": 87.0777, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.975, + "step": 1960 + }, + { + "entropy": 0.3226448342204094, + "epoch": 4.926525529265255, + "grad_norm": 0.6945561766624451, + "learning_rate": 0.0001357779854299694, + "loss": 0.24048397541046143, + "mean_token_accuracy": 0.9195300146937371, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.38581624263247777, + "eval_loss": 0.6029234528541565, + "eval_mean_token_accuracy": 0.8514213260523108, + "eval_num_tokens": 4622316.0, + "eval_runtime": 85.8729, + "eval_samples_per_second": 16.012, + "eval_steps_per_second": 2.003, + "step": 1980 + }, + { + "entropy": 0.3051655298098922, + "epoch": 4.976338729763388, + "grad_norm": 0.7976452708244324, + "learning_rate": 0.00013384956622874001, + "loss": 0.23584742546081544, + "mean_token_accuracy": 0.9216851457953453, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.37913159246361533, + "eval_loss": 0.6057604551315308, + "eval_mean_token_accuracy": 0.8525801203971686, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.1145, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 2000 + }, + { + "entropy": 0.27438195240803254, + "epoch": 5.024906600249066, + "grad_norm": 0.6729586124420166, + "learning_rate": 0.0001319149012229075, + "loss": 0.19775952100753785, + "mean_token_accuracy": 0.9339428559327737, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.3448961910813354, + "eval_loss": 0.6750120520591736, + "eval_mean_token_accuracy": 0.8487970232963562, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.1169, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 2020 + }, + { + "entropy": 0.21423916313797237, + "epoch": 5.074719800747198, + "grad_norm": 0.6934391856193542, + "learning_rate": 0.00012997457388105022, + "loss": 0.1439570426940918, + "mean_token_accuracy": 0.9528236843645572, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.3570949243771475, + "eval_loss": 0.6465504169464111, + "eval_mean_token_accuracy": 0.8490785547467166, + "eval_num_tokens": 4763269.0, + "eval_runtime": 85.9574, + "eval_samples_per_second": 15.996, + "eval_steps_per_second": 2.001, + "step": 2040 + }, + { + "entropy": 0.20838565267622472, + "epoch": 5.12453300124533, + "grad_norm": 0.7286986112594604, + "learning_rate": 0.00012802916937942972, + "loss": 0.14467307329177856, + "mean_token_accuracy": 0.950994835793972, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.3452463157821533, + "eval_loss": 0.6705958843231201, + "eval_mean_token_accuracy": 0.8490352796953778, + "eval_num_tokens": 4809047.0, + "eval_runtime": 86.228, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 2060 + }, + { + "entropy": 0.20453082229942082, + "epoch": 5.174346201743462, + "grad_norm": 0.7515555620193481, + "learning_rate": 0.00012607927442550974, + "loss": 0.13732000589370727, + "mean_token_accuracy": 0.9537357829511166, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.32431264914745506, + "eval_loss": 0.6743043065071106, + "eval_mean_token_accuracy": 0.8504878629085629, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.5948, + "eval_samples_per_second": 15.879, + "eval_steps_per_second": 1.986, + "step": 2080 + }, + { + "entropy": 0.21812320686876774, + "epoch": 5.224159402241594, + "grad_norm": 0.9093465209007263, + "learning_rate": 0.0001241254770810132, + "loss": 0.14311420917510986, + "mean_token_accuracy": 0.9514068141579628, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.33086285835435225, + "eval_loss": 0.6676449179649353, + "eval_mean_token_accuracy": 0.8505287662495015, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 2100 + }, + { + "entropy": 0.2180163251236081, + "epoch": 5.273972602739726, + "grad_norm": 0.6703007221221924, + "learning_rate": 0.00012216836658457075, + "loss": 0.14803968667984008, + "mean_token_accuracy": 0.9521303348243236, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.33162341708707255, + "eval_loss": 0.6658875942230225, + "eval_mean_token_accuracy": 0.8500757605530495, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.6296, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 2120 + }, + { + "entropy": 0.22511130161583423, + "epoch": 5.323785803237858, + "grad_norm": 0.8078880906105042, + "learning_rate": 0.00012020853317401455, + "loss": 0.15228408575057983, + "mean_token_accuracy": 0.947144789993763, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3354601170434508, + "eval_loss": 0.6677829623222351, + "eval_mean_token_accuracy": 0.8482600024273229, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.4689, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.989, + "step": 2140 + }, + { + "entropy": 0.2244176059961319, + "epoch": 5.37359900373599, + "grad_norm": 0.9636075496673584, + "learning_rate": 0.00011824656790837037, + "loss": 0.15260883569717407, + "mean_token_accuracy": 0.9471467643976211, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.3381616926297199, + "eval_loss": 0.6694412231445312, + "eval_mean_token_accuracy": 0.8482369603805764, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.4147, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 2160 + }, + { + "entropy": 0.22982364390045404, + "epoch": 5.423412204234122, + "grad_norm": 0.775401771068573, + "learning_rate": 0.00011628306248960262, + "loss": 0.15140302181243898, + "mean_token_accuracy": 0.9492553934454918, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.3305150235808173, + "eval_loss": 0.6717822551727295, + "eval_mean_token_accuracy": 0.8489849723355715, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.4728, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.989, + "step": 2180 + }, + { + "entropy": 0.21448935717344284, + "epoch": 5.473225404732254, + "grad_norm": 0.6575281023979187, + "learning_rate": 0.00011431860908416465, + "loss": 0.1452319622039795, + "mean_token_accuracy": 0.9505287684500218, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3488145174328671, + "eval_loss": 0.6612305641174316, + "eval_mean_token_accuracy": 0.8492907808963642, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6927, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 2200 + }, + { + "entropy": 0.23091202937066554, + "epoch": 5.523038605230386, + "grad_norm": 0.8909686207771301, + "learning_rate": 0.00011235380014440985, + "loss": 0.15150139331817628, + "mean_token_accuracy": 0.9497875183820724, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.3268539015810157, + "eval_loss": 0.6667542457580566, + "eval_mean_token_accuracy": 0.8499062903398691, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.4644, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 2220 + }, + { + "entropy": 0.2227974807843566, + "epoch": 5.572851805728518, + "grad_norm": 0.6180275082588196, + "learning_rate": 0.0001103892282299158, + "loss": 0.1491069197654724, + "mean_token_accuracy": 0.9488144010305405, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3346347655494546, + "eval_loss": 0.6665948629379272, + "eval_mean_token_accuracy": 0.8499961893918903, + "eval_num_tokens": 5226864.0, + "eval_runtime": 87.0548, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.976, + "step": 2240 + }, + { + "entropy": 0.21368421968072654, + "epoch": 5.62266500622665, + "grad_norm": 0.6004369258880615, + "learning_rate": 0.00010842548582877651, + "loss": 0.14485255479812623, + "mean_token_accuracy": 0.9502056457102299, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.32753298804163933, + "eval_loss": 0.6680151224136353, + "eval_mean_token_accuracy": 0.8515451086121936, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.8524, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.98, + "step": 2260 + }, + { + "entropy": 0.2103635374456644, + "epoch": 5.672478206724782, + "grad_norm": 0.699174702167511, + "learning_rate": 0.00010646316517891613, + "loss": 0.14297772645950318, + "mean_token_accuracy": 0.9512537539005279, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.32966585959806, + "eval_loss": 0.675578773021698, + "eval_mean_token_accuracy": 0.8509623023659684, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.4518, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.99, + "step": 2280 + }, + { + "entropy": 0.22516900151968003, + "epoch": 5.722291407222914, + "grad_norm": 0.6637354493141174, + "learning_rate": 0.00010450285808947797, + "loss": 0.15202572345733642, + "mean_token_accuracy": 0.9482452072203159, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3369456917740578, + "eval_loss": 0.6697061061859131, + "eval_mean_token_accuracy": 0.848603522361711, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.6371, + "eval_samples_per_second": 15.871, + "eval_steps_per_second": 1.985, + "step": 2300 + }, + { + "entropy": 0.21841065725311637, + "epoch": 5.772104607721046, + "grad_norm": 0.7940268516540527, + "learning_rate": 0.00010254515576234297, + "loss": 0.14710167646408082, + "mean_token_accuracy": 0.9493498183786869, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3237486180177955, + "eval_loss": 0.6779657602310181, + "eval_mean_token_accuracy": 0.8500715313955794, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.1826, + "eval_samples_per_second": 15.954, + "eval_steps_per_second": 1.996, + "step": 2320 + }, + { + "entropy": 0.22146204356104135, + "epoch": 5.821917808219178, + "grad_norm": 0.9234833121299744, + "learning_rate": 0.00010059064861383132, + "loss": 0.14720046520233154, + "mean_token_accuracy": 0.9493872679769992, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.32365207564692167, + "eval_loss": 0.6704005002975464, + "eval_mean_token_accuracy": 0.8507985760306203, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.5494, + "eval_samples_per_second": 15.887, + "eval_steps_per_second": 1.987, + "step": 2340 + }, + { + "entropy": 0.20934011954814197, + "epoch": 5.87173100871731, + "grad_norm": 0.5547503232955933, + "learning_rate": 9.863992609664084e-05, + "loss": 0.1464867353439331, + "mean_token_accuracy": 0.9503875687718392, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.3330401429083458, + "eval_loss": 0.6659091114997864, + "eval_mean_token_accuracy": 0.8504848906467127, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.5855, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 2360 + }, + { + "entropy": 0.21678635366261007, + "epoch": 5.921544209215442, + "grad_norm": 0.570612907409668, + "learning_rate": 9.669357652207635e-05, + "loss": 0.14821385145187377, + "mean_token_accuracy": 0.9503940217196941, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3322022325077722, + "eval_loss": 0.6722489595413208, + "eval_mean_token_accuracy": 0.8489979422369669, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.2986, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 2380 + }, + { + "entropy": 0.20932920072227718, + "epoch": 5.971357409713574, + "grad_norm": 0.7879557609558105, + "learning_rate": 9.475218688262262e-05, + "loss": 0.14675841331481934, + "mean_token_accuracy": 0.9507176131010056, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.3199348642902319, + "eval_loss": 0.6698136329650879, + "eval_mean_token_accuracy": 0.8514142130003419, + "eval_num_tokens": 5605400.0, + "eval_runtime": 85.8995, + "eval_samples_per_second": 16.007, + "eval_steps_per_second": 2.002, + "step": 2400 + }, + { + "entropy": 0.21032143919131693, + "epoch": 6.019925280199253, + "grad_norm": 0.5823076367378235, + "learning_rate": 9.281634267491569e-05, + "loss": 0.13322267532348633, + "mean_token_accuracy": 0.9550939072401096, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.30206270117399303, + "eval_loss": 0.7093168497085571, + "eval_mean_token_accuracy": 0.8500627639681794, + "eval_num_tokens": 5648968.0, + "eval_runtime": 85.8128, + "eval_samples_per_second": 16.023, + "eval_steps_per_second": 2.004, + "step": 2420 + }, + { + "entropy": 0.1534628233872354, + "epoch": 6.069738480697385, + "grad_norm": 0.710133969783783, + "learning_rate": 9.088662772316508e-05, + "loss": 0.09078952670097351, + "mean_token_accuracy": 0.9678447999060154, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.28208133101809857, + "eval_loss": 0.7636417150497437, + "eval_mean_token_accuracy": 0.8494061477655588, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9724, + "eval_samples_per_second": 15.994, + "eval_steps_per_second": 2.001, + "step": 2440 + }, + { + "entropy": 0.16151462448760867, + "epoch": 6.119551681195516, + "grad_norm": 0.5793812274932861, + "learning_rate": 8.896362400308028e-05, + "loss": 0.09545697569847107, + "mean_token_accuracy": 0.9671573750674725, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.2833245605403601, + "eval_loss": 0.7402405738830566, + "eval_mean_token_accuracy": 0.8503523728875226, + "eval_num_tokens": 5745090.0, + "eval_runtime": 85.5461, + "eval_samples_per_second": 16.073, + "eval_steps_per_second": 2.011, + "step": 2460 + }, + { + "entropy": 0.15203177919611335, + "epoch": 6.169364881693649, + "grad_norm": 0.4251123368740082, + "learning_rate": 8.704791146635483e-05, + "loss": 0.09420782327651978, + "mean_token_accuracy": 0.9677386932075024, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.28572545962971313, + "eval_loss": 0.735416829586029, + "eval_mean_token_accuracy": 0.8487084663884584, + "eval_num_tokens": 5790333.0, + "eval_runtime": 85.4801, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.012, + "step": 2480 + }, + { + "entropy": 0.15587336672469973, + "epoch": 6.219178082191781, + "grad_norm": 0.4357028007507324, + "learning_rate": 8.514006786576085e-05, + "loss": 0.09429320096969604, + "mean_token_accuracy": 0.9682952925562859, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.2859006894882335, + "eval_loss": 0.7347224950790405, + "eval_mean_token_accuracy": 0.8501905518215757, + "eval_num_tokens": 5837321.0, + "eval_runtime": 85.7578, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.006, + "step": 2500 + }, + { + "entropy": 0.15765639198943973, + "epoch": 6.268991282689913, + "grad_norm": 0.47331130504608154, + "learning_rate": 8.324066858090663e-05, + "loss": 0.09571113586425781, + "mean_token_accuracy": 0.9683481335639954, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.29231513846059176, + "eval_loss": 0.7392512559890747, + "eval_mean_token_accuracy": 0.8486633983462356, + "eval_num_tokens": 5884398.0, + "eval_runtime": 85.7846, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.005, + "step": 2520 + }, + { + "entropy": 0.16176860257983208, + "epoch": 6.318804483188045, + "grad_norm": 0.6142018437385559, + "learning_rate": 8.135028644470992e-05, + "loss": 0.09486144185066223, + "mean_token_accuracy": 0.9682316601276397, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.2851274753379267, + "eval_loss": 0.7520816922187805, + "eval_mean_token_accuracy": 0.8501113649717597, + "eval_num_tokens": 5929876.0, + "eval_runtime": 85.9425, + "eval_samples_per_second": 15.999, + "eval_steps_per_second": 2.001, + "step": 2540 + }, + { + "entropy": 0.15404034564271568, + "epoch": 6.3686176836861765, + "grad_norm": 0.6051287651062012, + "learning_rate": 7.946949157063964e-05, + "loss": 0.09280472993850708, + "mean_token_accuracy": 0.9684635892510414, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28802703563557114, + "eval_loss": 0.7439162135124207, + "eval_mean_token_accuracy": 0.8499851770872293, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.0703, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.998, + "step": 2560 + }, + { + "entropy": 0.15343588953837753, + "epoch": 6.418430884184309, + "grad_norm": 0.4823743402957916, + "learning_rate": 7.759885118077701e-05, + "loss": 0.09000591039657593, + "mean_token_accuracy": 0.9699928767979145, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2795634938533916, + "eval_loss": 0.7647850513458252, + "eval_mean_token_accuracy": 0.8503464397995971, + "eval_num_tokens": 6025380.0, + "eval_runtime": 85.8886, + "eval_samples_per_second": 16.009, + "eval_steps_per_second": 2.003, + "step": 2580 + }, + { + "entropy": 0.15740026142448188, + "epoch": 6.468244084682441, + "grad_norm": 0.5082696676254272, + "learning_rate": 7.57389294347494e-05, + "loss": 0.09191849827766418, + "mean_token_accuracy": 0.9692809768021107, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2913342311458532, + "eval_loss": 0.7518694996833801, + "eval_mean_token_accuracy": 0.8483168302580367, + "eval_num_tokens": 6073349.0, + "eval_runtime": 85.5761, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.01, + "step": 2600 + }, + { + "entropy": 0.15922069251537324, + "epoch": 6.518057285180573, + "grad_norm": 0.3995199501514435, + "learning_rate": 7.389028725958736e-05, + "loss": 0.09584367871284485, + "mean_token_accuracy": 0.9685114495456218, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.2863075934177221, + "eval_loss": 0.7539381384849548, + "eval_mean_token_accuracy": 0.8507507083027862, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.112, + "eval_samples_per_second": 15.968, + "eval_steps_per_second": 1.997, + "step": 2620 + }, + { + "entropy": 0.16197575423866512, + "epoch": 6.567870485678705, + "grad_norm": 0.534295380115509, + "learning_rate": 7.205348218055678e-05, + "loss": 0.0961170256137848, + "mean_token_accuracy": 0.9674530044198036, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.29021967315050057, + "eval_loss": 0.751198947429657, + "eval_mean_token_accuracy": 0.8509796344956686, + "eval_num_tokens": 6165523.0, + "eval_runtime": 85.7958, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.005, + "step": 2640 + }, + { + "entropy": 0.15261746793985367, + "epoch": 6.617683686176837, + "grad_norm": 0.5391237139701843, + "learning_rate": 7.022906815301673e-05, + "loss": 0.0926026999950409, + "mean_token_accuracy": 0.9695659473538398, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.29128045216202736, + "eval_loss": 0.7450292110443115, + "eval_mean_token_accuracy": 0.8498771443616512, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.3963, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 2660 + }, + { + "entropy": 0.16164180357009172, + "epoch": 6.667496886674969, + "grad_norm": 0.5767946243286133, + "learning_rate": 6.841759539535419e-05, + "loss": 0.09291981458663941, + "mean_token_accuracy": 0.9687136687338352, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2897637223088464, + "eval_loss": 0.7503410577774048, + "eval_mean_token_accuracy": 0.8503315164599308, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.0653, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.998, + "step": 2680 + }, + { + "entropy": 0.17062523355707526, + "epoch": 6.717310087173101, + "grad_norm": 0.4974168539047241, + "learning_rate": 6.661961022304563e-05, + "loss": 0.09713236689567566, + "mean_token_accuracy": 0.9661971725523472, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2765843396963075, + "eval_loss": 0.7604002356529236, + "eval_mean_token_accuracy": 0.8521115277395692, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.1676, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 2700 + }, + { + "entropy": 0.17544092936441302, + "epoch": 6.767123287671232, + "grad_norm": 0.5523537993431091, + "learning_rate": 6.483565488389582e-05, + "loss": 0.09709116220474243, + "mean_token_accuracy": 0.9650957375764847, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.27939334659035814, + "eval_loss": 0.7534670829772949, + "eval_mean_token_accuracy": 0.851230604010959, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.2913, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 2720 + }, + { + "entropy": 0.15991022661328316, + "epoch": 6.816936488169365, + "grad_norm": 0.478551983833313, + "learning_rate": 6.306626739450311e-05, + "loss": 0.09564646482467651, + "mean_token_accuracy": 0.9679084822535515, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.27878295491601146, + "eval_loss": 0.7519959211349487, + "eval_mean_token_accuracy": 0.8510654949864676, + "eval_num_tokens": 6397720.0, + "eval_runtime": 85.9109, + "eval_samples_per_second": 16.005, + "eval_steps_per_second": 2.002, + "step": 2740 + }, + { + "entropy": 0.16824879590421915, + "epoch": 6.866749688667497, + "grad_norm": 0.6681098937988281, + "learning_rate": 6.131198137800108e-05, + "loss": 0.0962279736995697, + "mean_token_accuracy": 0.966830012947321, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.2834690434121808, + "eval_loss": 0.751922070980072, + "eval_mean_token_accuracy": 0.8521237577809844, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.3618, + "eval_samples_per_second": 15.921, + "eval_steps_per_second": 1.992, + "step": 2760 + }, + { + "entropy": 0.1518704930320382, + "epoch": 6.916562889165629, + "grad_norm": 0.5201290249824524, + "learning_rate": 5.957332590312513e-05, + "loss": 0.09010660648345947, + "mean_token_accuracy": 0.9693463340401649, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.28485129617674404, + "eval_loss": 0.7452457547187805, + "eval_mean_token_accuracy": 0.8512036796919135, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.4524, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.99, + "step": 2780 + }, + { + "entropy": 0.15512610590085388, + "epoch": 6.966376089663761, + "grad_norm": 0.42802050709724426, + "learning_rate": 5.785082532465233e-05, + "loss": 0.09320432543754578, + "mean_token_accuracy": 0.9686134628951549, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.27554594526110693, + "eval_loss": 0.7644653916358948, + "eval_mean_token_accuracy": 0.8513738523389018, + "eval_num_tokens": 6540175.0, + "eval_runtime": 85.7609, + "eval_samples_per_second": 16.033, + "eval_steps_per_second": 2.006, + "step": 2800 + }, + { + "entropy": 0.17524497526196334, + "epoch": 7.01494396014944, + "grad_norm": 0.3330269157886505, + "learning_rate": 5.6144999125263545e-05, + "loss": 0.0895616888999939, + "mean_token_accuracy": 0.9682766932707566, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.2735865569218647, + "eval_loss": 0.768479585647583, + "eval_mean_token_accuracy": 0.8503459383581959, + "eval_num_tokens": 6583767.0, + "eval_runtime": 85.7162, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.007, + "step": 2820 + }, + { + "entropy": 0.1403565663844347, + "epoch": 7.064757160647572, + "grad_norm": 0.35613498091697693, + "learning_rate": 5.4456361758874235e-05, + "loss": 0.07551313638687134, + "mean_token_accuracy": 0.9739301167428493, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.25941789089593775, + "eval_loss": 0.8209511637687683, + "eval_mean_token_accuracy": 0.8505055855873019, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.0943, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 2840 + }, + { + "entropy": 0.13500106502324344, + "epoch": 7.114570361145703, + "grad_norm": 0.34418627619743347, + "learning_rate": 5.2785422495482234e-05, + "loss": 0.07293946146965027, + "mean_token_accuracy": 0.9747208289802074, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.26482899772912954, + "eval_loss": 0.798904538154602, + "eval_mean_token_accuracy": 0.8511530233677044, + "eval_num_tokens": 6672946.0, + "eval_runtime": 85.7915, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.005, + "step": 2860 + }, + { + "entropy": 0.13127502552233636, + "epoch": 7.164383561643835, + "grad_norm": 0.4638441503047943, + "learning_rate": 5.113268526757892e-05, + "loss": 0.07121461629867554, + "mean_token_accuracy": 0.9756786689162255, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2645381211714689, + "eval_loss": 0.809101939201355, + "eval_mean_token_accuracy": 0.8514727898115335, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.84, + "eval_samples_per_second": 16.018, + "eval_steps_per_second": 2.004, + "step": 2880 + }, + { + "entropy": 0.1331390908919275, + "epoch": 7.214196762141968, + "grad_norm": 0.40206775069236755, + "learning_rate": 4.949864851817007e-05, + "loss": 0.07188264131546021, + "mean_token_accuracy": 0.9755406074225903, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.26244733283339544, + "eval_loss": 0.8143188953399658, + "eval_mean_token_accuracy": 0.8514358189909957, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.8546, + "eval_samples_per_second": 16.015, + "eval_steps_per_second": 2.003, + "step": 2900 + }, + { + "entropy": 0.13647331558167936, + "epoch": 7.2640099626401, + "grad_norm": 0.26405787467956543, + "learning_rate": 4.788380505045224e-05, + "loss": 0.07412450313568116, + "mean_token_accuracy": 0.9744274213910102, + "num_tokens": 6809678.0, + "step": 2920 + }, + { + "epoch": 7.2640099626401, + "eval_entropy": 0.2626111418182074, + "eval_loss": 0.8111525177955627, + "eval_mean_token_accuracy": 0.8512121695418691, + "eval_num_tokens": 6809678.0, + "eval_runtime": 85.9626, + "eval_samples_per_second": 15.995, + "eval_steps_per_second": 2.001, + "step": 2920 + }, + { + "entropy": 0.12644002586603165, + "epoch": 7.313823163138232, + "grad_norm": 0.27514681220054626, + "learning_rate": 4.6288641879189884e-05, + "loss": 0.06807711124420165, + "mean_token_accuracy": 0.9760703906416893, + "num_tokens": 6860750.0, + "step": 2940 + }, + { + "epoch": 7.313823163138232, + "eval_entropy": 0.26096762734097106, + "eval_loss": 0.8184595108032227, + "eval_mean_token_accuracy": 0.8501476153384807, + "eval_num_tokens": 6860750.0, + "eval_runtime": 85.9521, + "eval_samples_per_second": 15.997, + "eval_steps_per_second": 2.001, + "step": 2940 + }, + { + "entropy": 0.13920630998909472, + "epoch": 7.363636363636363, + "grad_norm": 0.23584705591201782, + "learning_rate": 4.4713640083838604e-05, + "loss": 0.07301607131958007, + "mean_token_accuracy": 0.9745715200901032, + "num_tokens": 6907092.0, + "step": 2960 + }, + { + "epoch": 7.363636363636363, + "eval_entropy": 0.2612536767021168, + "eval_loss": 0.8116245269775391, + "eval_mean_token_accuracy": 0.8510967350976412, + "eval_num_tokens": 6907092.0, + "eval_runtime": 85.6373, + "eval_samples_per_second": 16.056, + "eval_steps_per_second": 2.008, + "step": 2960 + }, + { + "entropy": 0.1349492883309722, + "epoch": 7.4134495641344955, + "grad_norm": 0.24552719295024872, + "learning_rate": 4.315927466345791e-05, + "loss": 0.07397544980049134, + "mean_token_accuracy": 0.9745095103979111, + "num_tokens": 6952700.0, + "step": 2980 + }, + { + "epoch": 7.4134495641344955, + "eval_entropy": 0.25796533306670744, + "eval_loss": 0.8266491293907166, + "eval_mean_token_accuracy": 0.8511653857868772, + "eval_num_tokens": 6952700.0, + "eval_runtime": 85.7462, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.006, + "step": 2980 + }, + { + "entropy": 0.14479175000451505, + "epoch": 7.463262764632628, + "grad_norm": 0.2846072018146515, + "learning_rate": 4.162601439345814e-05, + "loss": 0.07544798254966736, + "mean_token_accuracy": 0.9727819666266442, + "num_tokens": 6996430.0, + "step": 3000 + }, + { + "epoch": 7.463262764632628, + "eval_entropy": 0.2584348309698493, + "eval_loss": 0.8253348469734192, + "eval_mean_token_accuracy": 0.8511569815319638, + "eval_num_tokens": 6996430.0, + "eval_runtime": 86.2984, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 3000 + }, + { + "entropy": 0.14114196319133043, + "epoch": 7.51307596513076, + "grad_norm": 0.407966285943985, + "learning_rate": 4.011432168422419e-05, + "loss": 0.0736398994922638, + "mean_token_accuracy": 0.9741654269397259, + "num_tokens": 7042038.0, + "step": 3020 + }, + { + "epoch": 7.51307596513076, + "eval_entropy": 0.25232676260693127, + "eval_loss": 0.8296052813529968, + "eval_mean_token_accuracy": 0.8523298349491385, + "eval_num_tokens": 7042038.0, + "eval_runtime": 85.8445, + "eval_samples_per_second": 16.017, + "eval_steps_per_second": 2.004, + "step": 3020 + }, + { + "entropy": 0.1353456223383546, + "epoch": 7.562889165628892, + "grad_norm": 0.2712634801864624, + "learning_rate": 3.8624652441658684e-05, + "loss": 0.07362412214279175, + "mean_token_accuracy": 0.9747945807874203, + "num_tokens": 7089390.0, + "step": 3040 + }, + { + "epoch": 7.562889165628892, + "eval_entropy": 0.2579477243991785, + "eval_loss": 0.8274564743041992, + "eval_mean_token_accuracy": 0.8517705212498821, + "eval_num_tokens": 7089390.0, + "eval_runtime": 85.8222, + "eval_samples_per_second": 16.022, + "eval_steps_per_second": 2.004, + "step": 3040 + }, + { + "entropy": 0.1296080862637609, + "epoch": 7.6127023661270234, + "grad_norm": 0.2371893972158432, + "learning_rate": 3.715745592968707e-05, + "loss": 0.06971035599708557, + "mean_token_accuracy": 0.9759043246507645, + "num_tokens": 7138002.0, + "step": 3060 + }, + { + "epoch": 7.6127023661270234, + "eval_entropy": 0.25391967083479083, + "eval_loss": 0.8197130560874939, + "eval_mean_token_accuracy": 0.8522267875283264, + "eval_num_tokens": 7138002.0, + "eval_runtime": 85.8796, + "eval_samples_per_second": 16.011, + "eval_steps_per_second": 2.003, + "step": 3060 + }, + { + "entropy": 0.1311203008517623, + "epoch": 7.662515566625156, + "grad_norm": 0.22499267756938934, + "learning_rate": 3.5713174634765967e-05, + "loss": 0.07176244258880615, + "mean_token_accuracy": 0.9754939571022987, + "num_tokens": 7185520.0, + "step": 3080 + }, + { + "epoch": 7.662515566625156, + "eval_entropy": 0.2526215241225653, + "eval_loss": 0.8265154361724854, + "eval_mean_token_accuracy": 0.8519952584837758, + "eval_num_tokens": 7185520.0, + "eval_runtime": 85.8746, + "eval_samples_per_second": 16.012, + "eval_steps_per_second": 2.003, + "step": 3080 + }, + { + "entropy": 0.13420484317466616, + "epoch": 7.712328767123288, + "grad_norm": 0.2398064285516739, + "learning_rate": 3.4292244132434866e-05, + "loss": 0.07559212446212768, + "mean_token_accuracy": 0.9743142127990723, + "num_tokens": 7232170.0, + "step": 3100 + }, + { + "epoch": 7.712328767123288, + "eval_entropy": 0.2484562756537005, + "eval_loss": 0.8312150239944458, + "eval_mean_token_accuracy": 0.8528405119513356, + "eval_num_tokens": 7232170.0, + "eval_runtime": 85.7896, + "eval_samples_per_second": 16.028, + "eval_steps_per_second": 2.005, + "step": 3100 + }, + { + "entropy": 0.11965563679113984, + "epoch": 7.76214196762142, + "grad_norm": 0.3408384919166565, + "learning_rate": 3.2895092955952746e-05, + "loss": 0.0661750853061676, + "mean_token_accuracy": 0.9776600524783134, + "num_tokens": 7282846.0, + "step": 3120 + }, + { + "epoch": 7.76214196762142, + "eval_entropy": 0.2522421533804993, + "eval_loss": 0.8327009677886963, + "eval_mean_token_accuracy": 0.8524222023958383, + "eval_num_tokens": 7282846.0, + "eval_runtime": 86.1769, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 1.996, + "step": 3120 + }, + { + "entropy": 0.13388084415346385, + "epoch": 7.811955168119551, + "grad_norm": 0.35418516397476196, + "learning_rate": 3.152214246705829e-05, + "loss": 0.07149899601936341, + "mean_token_accuracy": 0.9747635535895824, + "num_tokens": 7331518.0, + "step": 3140 + }, + { + "epoch": 7.811955168119551, + "eval_entropy": 0.25038352296795957, + "eval_loss": 0.836457371711731, + "eval_mean_token_accuracy": 0.8526130665180295, + "eval_num_tokens": 7331518.0, + "eval_runtime": 85.6099, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.009, + "step": 3140 + }, + { + "entropy": 0.13530643959529698, + "epoch": 7.861768368617684, + "grad_norm": 0.38060539960861206, + "learning_rate": 3.017380672889291e-05, + "loss": 0.07116585969924927, + "mean_token_accuracy": 0.973284512758255, + "num_tokens": 7379056.0, + "step": 3160 + }, + { + "epoch": 7.861768368617684, + "eval_entropy": 0.255092611319797, + "eval_loss": 0.8314701914787292, + "eval_mean_token_accuracy": 0.8520913099826768, + "eval_num_tokens": 7379056.0, + "eval_runtime": 85.877, + "eval_samples_per_second": 16.011, + "eval_steps_per_second": 2.003, + "step": 3160 + }, + { + "entropy": 0.13383390177041293, + "epoch": 7.911581569115816, + "grad_norm": 0.3827536106109619, + "learning_rate": 2.8850492381124808e-05, + "loss": 0.07305437326431274, + "mean_token_accuracy": 0.9750778004527092, + "num_tokens": 7424770.0, + "step": 3180 + }, + { + "epoch": 7.911581569115816, + "eval_entropy": 0.25416371157003004, + "eval_loss": 0.8206402063369751, + "eval_mean_token_accuracy": 0.852779901651449, + "eval_num_tokens": 7424770.0, + "eval_runtime": 86.1015, + "eval_samples_per_second": 15.97, + "eval_steps_per_second": 1.998, + "step": 3180 + }, + { + "entropy": 0.1395680439658463, + "epoch": 7.961394769613948, + "grad_norm": 0.3809775412082672, + "learning_rate": 2.7552598517312256e-05, + "loss": 0.07236042022705078, + "mean_token_accuracy": 0.9731538116931915, + "num_tokens": 7470804.0, + "step": 3200 + }, + { + "epoch": 7.961394769613948, + "eval_entropy": 0.25528111975899964, + "eval_loss": 0.8230037093162537, + "eval_mean_token_accuracy": 0.8526452603035195, + "eval_num_tokens": 7470804.0, + "eval_runtime": 85.7895, + "eval_samples_per_second": 16.028, + "eval_steps_per_second": 2.005, + "step": 3200 + }, + { + "entropy": 0.12193699864049752, + "epoch": 8.009962640099626, + "grad_norm": 0.11854425817728043, + "learning_rate": 2.6280516564542205e-05, + "loss": 0.06617764234542847, + "mean_token_accuracy": 0.977179691577569, + "num_tokens": 7518110.0, + "step": 3220 + }, + { + "epoch": 8.009962640099626, + "eval_entropy": 0.25100527677771656, + "eval_loss": 0.8393343687057495, + "eval_mean_token_accuracy": 0.8522553132023922, + "eval_num_tokens": 7518110.0, + "eval_runtime": 85.8837, + "eval_samples_per_second": 16.01, + "eval_steps_per_second": 2.003, + "step": 3220 + }, + { + "entropy": 0.12788885813206435, + "epoch": 8.059775840597759, + "grad_norm": 0.16094881296157837, + "learning_rate": 2.50346301653812e-05, + "loss": 0.06274186968803405, + "mean_token_accuracy": 0.9766994707286358, + "num_tokens": 7565539.0, + "step": 3240 + }, + { + "epoch": 8.059775840597759, + "eval_entropy": 0.24409458682287571, + "eval_loss": 0.874617338180542, + "eval_mean_token_accuracy": 0.8521041180505309, + "eval_num_tokens": 7565539.0, + "eval_runtime": 86.2656, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 3240 + }, + { + "entropy": 0.12464155335910618, + "epoch": 8.10958904109589, + "grad_norm": 0.16893954575061798, + "learning_rate": 2.381531506217437e-05, + "loss": 0.06093020439147949, + "mean_token_accuracy": 0.9776258453726768, + "num_tokens": 7612578.0, + "step": 3260 + }, + { + "epoch": 8.10958904109589, + "eval_entropy": 0.24396493017326953, + "eval_loss": 0.891161322593689, + "eval_mean_token_accuracy": 0.8515338024427724, + "eval_num_tokens": 7612578.0, + "eval_runtime": 85.9061, + "eval_samples_per_second": 16.006, + "eval_steps_per_second": 2.002, + "step": 3260 + }, + { + "entropy": 0.12345920228399336, + "epoch": 8.159402241594023, + "grad_norm": 0.14332273602485657, + "learning_rate": 2.262293898372616e-05, + "loss": 0.061289966106414795, + "mean_token_accuracy": 0.9762230902910233, + "num_tokens": 7660157.0, + "step": 3280 + }, + { + "epoch": 8.159402241594023, + "eval_entropy": 0.2481445314059424, + "eval_loss": 0.8922848105430603, + "eval_mean_token_accuracy": 0.8514944855556932, + "eval_num_tokens": 7660157.0, + "eval_runtime": 85.5201, + "eval_samples_per_second": 16.078, + "eval_steps_per_second": 2.011, + "step": 3280 + }, + { + "entropy": 0.12298110066913068, + "epoch": 8.209215442092155, + "grad_norm": 0.21848882734775543, + "learning_rate": 2.1457861534398633e-05, + "loss": 0.05986443758010864, + "mean_token_accuracy": 0.9786281704902648, + "num_tokens": 7709745.0, + "step": 3300 + }, + { + "epoch": 8.209215442092155, + "eval_entropy": 0.24329388124305149, + "eval_loss": 0.9021085500717163, + "eval_mean_token_accuracy": 0.8521762625422589, + "eval_num_tokens": 7709745.0, + "eval_runtime": 85.955, + "eval_samples_per_second": 15.997, + "eval_steps_per_second": 2.001, + "step": 3300 + }, + { + "entropy": 0.13265180448070168, + "epoch": 8.259028642590286, + "grad_norm": 0.18067947030067444, + "learning_rate": 2.0320434085659692e-05, + "loss": 0.06724961400032044, + "mean_token_accuracy": 0.975098168104887, + "num_tokens": 7753571.0, + "step": 3320 + }, + { + "epoch": 8.259028642590286, + "eval_entropy": 0.2433211464694766, + "eval_loss": 0.9094350337982178, + "eval_mean_token_accuracy": 0.8520150094531304, + "eval_num_tokens": 7753571.0, + "eval_runtime": 85.7989, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.005, + "step": 3320 + }, + { + "entropy": 0.11949320202693343, + "epoch": 8.308841843088418, + "grad_norm": 0.17020289599895477, + "learning_rate": 1.9210999670114196e-05, + "loss": 0.0634455680847168, + "mean_token_accuracy": 0.9771294385194779, + "num_tokens": 7799310.0, + "step": 3340 + }, + { + "epoch": 8.308841843088418, + "eval_entropy": 0.24345201219237128, + "eval_loss": 0.9021793603897095, + "eval_mean_token_accuracy": 0.8520745697409607, + "eval_num_tokens": 7799310.0, + "eval_runtime": 86.0883, + "eval_samples_per_second": 15.972, + "eval_steps_per_second": 1.998, + "step": 3340 + }, + { + "entropy": 0.12065747743472457, + "epoch": 8.35865504358655, + "grad_norm": 0.16789060831069946, + "learning_rate": 1.8129892878049886e-05, + "loss": 0.061494195461273195, + "mean_token_accuracy": 0.9779584899544715, + "num_tokens": 7846447.0, + "step": 3360 + }, + { + "epoch": 8.35865504358655, + "eval_entropy": 0.24093415042342142, + "eval_loss": 0.9006755352020264, + "eval_mean_token_accuracy": 0.852174230786257, + "eval_num_tokens": 7846447.0, + "eval_runtime": 85.9011, + "eval_samples_per_second": 16.007, + "eval_steps_per_second": 2.002, + "step": 3360 + }, + { + "entropy": 0.13125578537583352, + "epoch": 8.408468244084682, + "grad_norm": 0.1662452220916748, + "learning_rate": 1.70774397565298e-05, + "loss": 0.06685600876808166, + "mean_token_accuracy": 0.9744067586958408, + "num_tokens": 7890283.0, + "step": 3380 + }, + { + "epoch": 8.408468244084682, + "eval_entropy": 0.24062153688350388, + "eval_loss": 0.9078915119171143, + "eval_mean_token_accuracy": 0.8523201647886011, + "eval_num_tokens": 7890283.0, + "eval_runtime": 86.0201, + "eval_samples_per_second": 15.985, + "eval_steps_per_second": 2.0, + "step": 3380 + }, + { + "entropy": 0.11986117120832204, + "epoch": 8.458281444582815, + "grad_norm": 0.19571948051452637, + "learning_rate": 1.6053957711060606e-05, + "loss": 0.06411095261573792, + "mean_token_accuracy": 0.9770627245306969, + "num_tokens": 7936518.0, + "step": 3400 + }, + { + "epoch": 8.458281444582815, + "eval_entropy": 0.24352820347561394, + "eval_loss": 0.9058943390846252, + "eval_mean_token_accuracy": 0.8519382792156797, + "eval_num_tokens": 7936518.0, + "eval_runtime": 85.966, + "eval_samples_per_second": 15.995, + "eval_steps_per_second": 2.001, + "step": 3400 + }, + { + "entropy": 0.12857897616922856, + "epoch": 8.508094645080947, + "grad_norm": 0.2609264850616455, + "learning_rate": 1.5059755409867613e-05, + "loss": 0.06473397612571716, + "mean_token_accuracy": 0.9764650195837021, + "num_tokens": 7981966.0, + "step": 3420 + }, + { + "epoch": 8.508094645080947, + "eval_entropy": 0.24032609000108962, + "eval_loss": 0.9077776074409485, + "eval_mean_token_accuracy": 0.8517829197090726, + "eval_num_tokens": 7981966.0, + "eval_runtime": 86.6059, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 3420 + }, + { + "entropy": 0.12348870886489749, + "epoch": 8.557907845579079, + "grad_norm": 0.19537609815597534, + "learning_rate": 1.409513269080473e-05, + "loss": 0.06481348872184753, + "mean_token_accuracy": 0.9769559659063816, + "num_tokens": 8028367.0, + "step": 3440 + }, + { + "epoch": 8.557907845579079, + "eval_entropy": 0.2404322574824788, + "eval_loss": 0.9057720899581909, + "eval_mean_token_accuracy": 0.8521037981953732, + "eval_num_tokens": 8028367.0, + "eval_runtime": 86.166, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.996, + "step": 3440 + }, + { + "entropy": 0.12040232736617326, + "epoch": 8.607721046077211, + "grad_norm": 0.3310582935810089, + "learning_rate": 1.3160380470927183e-05, + "loss": 0.06468871235847473, + "mean_token_accuracy": 0.9768650442361831, + "num_tokens": 8074934.0, + "step": 3460 + }, + { + "epoch": 8.607721046077211, + "eval_entropy": 0.24118655876711356, + "eval_loss": 0.9028318524360657, + "eval_mean_token_accuracy": 0.8521025340224422, + "eval_num_tokens": 8074934.0, + "eval_runtime": 85.3668, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.015, + "step": 3460 + }, + { + "entropy": 0.12328103906475008, + "epoch": 8.657534246575342, + "grad_norm": 0.12836167216300964, + "learning_rate": 1.2255780658755122e-05, + "loss": 0.06229386329650879, + "mean_token_accuracy": 0.9763277888298034, + "num_tokens": 8122775.0, + "step": 3480 + }, + { + "epoch": 8.657534246575342, + "eval_entropy": 0.24194598145956217, + "eval_loss": 0.9009329080581665, + "eval_mean_token_accuracy": 0.8521693289973015, + "eval_num_tokens": 8122775.0, + "eval_runtime": 85.9415, + "eval_samples_per_second": 15.999, + "eval_steps_per_second": 2.001, + "step": 3480 + }, + { + "entropy": 0.11321646976284683, + "epoch": 8.707347447073474, + "grad_norm": 0.15656894445419312, + "learning_rate": 1.1381606069253786e-05, + "loss": 0.05908188819885254, + "mean_token_accuracy": 0.9779504477977753, + "num_tokens": 8174307.0, + "step": 3500 + }, + { + "epoch": 8.707347447073474, + "eval_entropy": 0.24121542517528977, + "eval_loss": 0.9016091823577881, + "eval_mean_token_accuracy": 0.8521790667328724, + "eval_num_tokens": 8174307.0, + "eval_runtime": 85.7465, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.006, + "step": 3500 + }, + { + "entropy": 0.12657046681270004, + "epoch": 8.757160647571606, + "grad_norm": 0.22597502171993256, + "learning_rate": 1.053812034155629e-05, + "loss": 0.06244581937789917, + "mean_token_accuracy": 0.976795207709074, + "num_tokens": 8222808.0, + "step": 3520 + }, + { + "epoch": 8.757160647571606, + "eval_entropy": 0.23877542708502258, + "eval_loss": 0.9069110155105591, + "eval_mean_token_accuracy": 0.8522880177858264, + "eval_num_tokens": 8222808.0, + "eval_runtime": 85.7792, + "eval_samples_per_second": 16.03, + "eval_steps_per_second": 2.005, + "step": 3520 + }, + { + "entropy": 0.11422101808711886, + "epoch": 8.806973848069738, + "grad_norm": 0.21139323711395264, + "learning_rate": 9.725577859453502e-06, + "loss": 0.05988085865974426, + "mean_token_accuracy": 0.9779510758817196, + "num_tokens": 8273335.0, + "step": 3540 + }, + { + "epoch": 8.806973848069738, + "eval_entropy": 0.2393161087881687, + "eval_loss": 0.9033801555633545, + "eval_mean_token_accuracy": 0.8522614209457885, + "eval_num_tokens": 8273335.0, + "eval_runtime": 85.5594, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 3540 + }, + { + "entropy": 0.13810604228638113, + "epoch": 8.85678704856787, + "grad_norm": 0.24571993947029114, + "learning_rate": 8.944223674675537e-06, + "loss": 0.07036117911338806, + "mean_token_accuracy": 0.9734892748296261, + "num_tokens": 8315235.0, + "step": 3560 + }, + { + "epoch": 8.85678704856787, + "eval_entropy": 0.23998506947658782, + "eval_loss": 0.9009848833084106, + "eval_mean_token_accuracy": 0.8521793619837872, + "eval_num_tokens": 8315235.0, + "eval_runtime": 86.0974, + "eval_samples_per_second": 15.97, + "eval_steps_per_second": 1.998, + "step": 3560 + }, + { + "entropy": 0.14193559321574867, + "epoch": 8.906600249066003, + "grad_norm": 0.17304112017154694, + "learning_rate": 8.194293432987386e-06, + "loss": 0.07077967524528503, + "mean_token_accuracy": 0.973305893689394, + "num_tokens": 8358099.0, + "step": 3580 + }, + { + "epoch": 8.906600249066003, + "eval_entropy": 0.23883876689644748, + "eval_loss": 0.9015622138977051, + "eval_mean_token_accuracy": 0.8524864378363587, + "eval_num_tokens": 8358099.0, + "eval_runtime": 86.0089, + "eval_samples_per_second": 15.987, + "eval_steps_per_second": 2.0, + "step": 3580 + }, + { + "entropy": 0.11878943420015275, + "epoch": 8.956413449564135, + "grad_norm": 0.19075658917427063, + "learning_rate": 7.476013303121426e-06, + "loss": 0.060806107521057126, + "mean_token_accuracy": 0.9776863709092141, + "num_tokens": 8407430.0, + "step": 3600 + }, + { + "epoch": 8.956413449564135, + "eval_entropy": 0.23726526309931, + "eval_loss": 0.9060276746749878, + "eval_mean_token_accuracy": 0.8524192058762838, + "eval_num_tokens": 8407430.0, + "eval_runtime": 85.7252, + "eval_samples_per_second": 16.04, + "eval_steps_per_second": 2.006, + "step": 3600 + }, + { + "entropy": 0.1255835090787747, + "epoch": 9.004981320049813, + "grad_norm": 0.11608047038316727, + "learning_rate": 6.78959990856799e-06, + "loss": 0.06319612860679627, + "mean_token_accuracy": 0.9766685519462976, + "num_tokens": 8453175.0, + "step": 3620 + }, + { + "epoch": 9.004981320049813, + "eval_entropy": 0.2373251837006835, + "eval_loss": 0.9045722484588623, + "eval_mean_token_accuracy": 0.8525558363559634, + "eval_num_tokens": 8453175.0, + "eval_runtime": 85.7435, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.006, + "step": 3620 + }, + { + "entropy": 0.12587778437882663, + "epoch": 9.054794520547945, + "grad_norm": 0.1564614623785019, + "learning_rate": 6.135260262244683e-06, + "loss": 0.0630365788936615, + "mean_token_accuracy": 0.9777486085891723, + "num_tokens": 8497151.0, + "step": 3640 + }, + { + "epoch": 9.054794520547945, + "eval_entropy": 0.23559923721260803, + "eval_loss": 0.9120694398880005, + "eval_mean_token_accuracy": 0.8525292966947999, + "eval_num_tokens": 8497151.0, + "eval_runtime": 85.8018, + "eval_samples_per_second": 16.025, + "eval_steps_per_second": 2.005, + "step": 3640 + }, + { + "entropy": 0.12535365503281354, + "epoch": 9.104607721046078, + "grad_norm": 0.1404249221086502, + "learning_rate": 5.513191704064086e-06, + "loss": 0.060502654314041136, + "mean_token_accuracy": 0.9770058333873749, + "num_tokens": 8542996.0, + "step": 3660 + }, + { + "epoch": 9.104607721046078, + "eval_entropy": 0.23525122691725575, + "eval_loss": 0.9182237982749939, + "eval_mean_token_accuracy": 0.8524098333924316, + "eval_num_tokens": 8542996.0, + "eval_runtime": 85.9872, + "eval_samples_per_second": 15.991, + "eval_steps_per_second": 2.0, + "step": 3660 + }, + { + "entropy": 0.11330419047735632, + "epoch": 9.15442092154421, + "grad_norm": 0.15513843297958374, + "learning_rate": 4.92358184141876e-06, + "loss": 0.05822383761405945, + "mean_token_accuracy": 0.9793384782969952, + "num_tokens": 8591625.0, + "step": 3680 + }, + { + "epoch": 9.15442092154421, + "eval_entropy": 0.2353947116711805, + "eval_loss": 0.9229223132133484, + "eval_mean_token_accuracy": 0.852500357253607, + "eval_num_tokens": 8591625.0, + "eval_runtime": 86.0805, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.998, + "step": 3680 + }, + { + "entropy": 0.11830627010203898, + "epoch": 9.204234122042342, + "grad_norm": 0.1730550080537796, + "learning_rate": 4.366608492601456e-06, + "loss": 0.05860854983329773, + "mean_token_accuracy": 0.9779663667082786, + "num_tokens": 8639845.0, + "step": 3700 + }, + { + "epoch": 9.204234122042342, + "eval_entropy": 0.23567205719476522, + "eval_loss": 0.9269373416900635, + "eval_mean_token_accuracy": 0.8523658004611038, + "eval_num_tokens": 8639845.0, + "eval_runtime": 85.9809, + "eval_samples_per_second": 15.992, + "eval_steps_per_second": 2.0, + "step": 3700 + }, + { + "entropy": 0.1180900705512613, + "epoch": 9.254047322540472, + "grad_norm": 0.20909737050533295, + "learning_rate": 3.842439633177387e-06, + "loss": 0.059438884258270264, + "mean_token_accuracy": 0.9786856278777123, + "num_tokens": 8687194.0, + "step": 3720 + }, + { + "epoch": 9.254047322540472, + "eval_entropy": 0.23602714493524196, + "eval_loss": 0.9293538928031921, + "eval_mean_token_accuracy": 0.8523273440294488, + "eval_num_tokens": 8687194.0, + "eval_runtime": 85.2118, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.019, + "step": 3720 + }, + { + "entropy": 0.13156692241318524, + "epoch": 9.303860523038605, + "grad_norm": 0.12535709142684937, + "learning_rate": 3.3512333453253305e-06, + "loss": 0.06337688565254211, + "mean_token_accuracy": 0.9756712593138218, + "num_tokens": 8731721.0, + "step": 3740 + }, + { + "epoch": 9.303860523038605, + "eval_entropy": 0.23534389351343, + "eval_loss": 0.932999312877655, + "eval_mean_token_accuracy": 0.8523333925147389, + "eval_num_tokens": 8731721.0, + "eval_runtime": 85.953, + "eval_samples_per_second": 15.997, + "eval_steps_per_second": 2.001, + "step": 3740 + }, + { + "entropy": 0.12327516414225101, + "epoch": 9.353673723536737, + "grad_norm": 0.16341575980186462, + "learning_rate": 2.8931377701619306e-06, + "loss": 0.05869622826576233, + "mean_token_accuracy": 0.9784224212169648, + "num_tokens": 8778614.0, + "step": 3760 + }, + { + "epoch": 9.353673723536737, + "eval_entropy": 0.23493653622477553, + "eval_loss": 0.9358566999435425, + "eval_mean_token_accuracy": 0.8522722783476807, + "eval_num_tokens": 8778614.0, + "eval_runtime": 85.2538, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.018, + "step": 3760 + }, + { + "entropy": 0.1134357453789562, + "epoch": 9.403486924034869, + "grad_norm": 0.23999616503715515, + "learning_rate": 2.4682910630645723e-06, + "loss": 0.057540220022201535, + "mean_token_accuracy": 0.9798057802021504, + "num_tokens": 8826551.0, + "step": 3780 + }, + { + "epoch": 9.403486924034869, + "eval_entropy": 0.23470525634150172, + "eval_loss": 0.937556266784668, + "eval_mean_token_accuracy": 0.8523351706044618, + "eval_num_tokens": 8826551.0, + "eval_runtime": 85.7764, + "eval_samples_per_second": 16.03, + "eval_steps_per_second": 2.005, + "step": 3780 + }, + { + "entropy": 0.1075570048764348, + "epoch": 9.453300124533001, + "grad_norm": 0.15417765080928802, + "learning_rate": 2.0768213520055406e-06, + "loss": 0.05581026673316956, + "mean_token_accuracy": 0.9797527104616165, + "num_tokens": 8876556.0, + "step": 3800 + }, + { + "epoch": 9.453300124533001, + "eval_entropy": 0.2347462713545145, + "eval_loss": 0.9383137226104736, + "eval_mean_token_accuracy": 0.8522575324357942, + "eval_num_tokens": 8876556.0, + "eval_runtime": 85.8985, + "eval_samples_per_second": 16.007, + "eval_steps_per_second": 2.002, + "step": 3800 + }, + { + "entropy": 0.12609313456341625, + "epoch": 9.503113325031133, + "grad_norm": 0.22041426599025726, + "learning_rate": 1.7188466989102739e-06, + "loss": 0.06379218697547913, + "mean_token_accuracy": 0.9763593293726445, + "num_tokens": 8920286.0, + "step": 3820 + }, + { + "epoch": 9.503113325031133, + "eval_entropy": 0.23459658849724505, + "eval_loss": 0.9393337965011597, + "eval_mean_token_accuracy": 0.8523633532052817, + "eval_num_tokens": 8920286.0, + "eval_runtime": 85.9348, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.002, + "step": 3820 + }, + { + "entropy": 0.12149709439836442, + "epoch": 9.552926525529266, + "grad_norm": 0.16608643531799316, + "learning_rate": 1.3944750640516357e-06, + "loss": 0.06341606974601746, + "mean_token_accuracy": 0.9771503552794456, + "num_tokens": 8964464.0, + "step": 3840 + }, + { + "epoch": 9.552926525529266, + "eval_entropy": 0.2347291322468325, + "eval_loss": 0.9399036765098572, + "eval_mean_token_accuracy": 0.8523768914300341, + "eval_num_tokens": 8964464.0, + "eval_runtime": 86.1305, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.997, + "step": 3840 + }, + { + "entropy": 0.11724846777506173, + "epoch": 9.602739726027398, + "grad_norm": 0.13613300025463104, + "learning_rate": 1.103804273490497e-06, + "loss": 0.05994418263435364, + "mean_token_accuracy": 0.9778759330511093, + "num_tokens": 9010414.0, + "step": 3860 + }, + { + "epoch": 9.602739726027398, + "eval_entropy": 0.23495923337894817, + "eval_loss": 0.9400841593742371, + "eval_mean_token_accuracy": 0.8523780471363733, + "eval_num_tokens": 9010414.0, + "eval_runtime": 86.0379, + "eval_samples_per_second": 15.981, + "eval_steps_per_second": 1.999, + "step": 3860 + }, + { + "entropy": 0.12054574331268668, + "epoch": 9.65255292652553, + "grad_norm": 0.11884245276451111, + "learning_rate": 8.469219895727582e-07, + "loss": 0.05917409062385559, + "mean_token_accuracy": 0.9771256923675538, + "num_tokens": 9058053.0, + "step": 3880 + }, + { + "epoch": 9.65255292652553, + "eval_entropy": 0.23499552723626757, + "eval_loss": 0.9404177665710449, + "eval_mean_token_accuracy": 0.8523571678372317, + "eval_num_tokens": 9058053.0, + "eval_runtime": 86.0174, + "eval_samples_per_second": 15.985, + "eval_steps_per_second": 2.0, + "step": 3880 + }, + { + "entropy": 0.12163264504633844, + "epoch": 9.70236612702366, + "grad_norm": 0.18393972516059875, + "learning_rate": 6.239056844915407e-07, + "loss": 0.059613007307052615, + "mean_token_accuracy": 0.9776720523834228, + "num_tokens": 9105574.0, + "step": 3900 + }, + { + "epoch": 9.70236612702366, + "eval_entropy": 0.23491846319547918, + "eval_loss": 0.9405836462974548, + "eval_mean_token_accuracy": 0.8523543633000795, + "eval_num_tokens": 9105574.0, + "eval_runtime": 85.9519, + "eval_samples_per_second": 15.997, + "eval_steps_per_second": 2.001, + "step": 3900 + }, + { + "entropy": 0.11569633753970265, + "epoch": 9.752179327521793, + "grad_norm": 0.1553788185119629, + "learning_rate": 4.3482261692267186e-07, + "loss": 0.05866732001304627, + "mean_token_accuracy": 0.9790047742426395, + "num_tokens": 9152793.0, + "step": 3920 + }, + { + "epoch": 9.752179327521793, + "eval_entropy": 0.23489533165513082, + "eval_loss": 0.9410145878791809, + "eval_mean_token_accuracy": 0.8524025068726651, + "eval_num_tokens": 9152793.0, + "eval_runtime": 85.5221, + "eval_samples_per_second": 16.078, + "eval_steps_per_second": 2.011, + "step": 3920 + }, + { + "entropy": 0.12030278495512903, + "epoch": 9.801992528019925, + "grad_norm": 0.20454250276088715, + "learning_rate": 2.797298117403634e-07, + "loss": 0.061210107803344724, + "mean_token_accuracy": 0.9774218738079071, + "num_tokens": 9199382.0, + "step": 3940 + }, + { + "epoch": 9.801992528019925, + "eval_entropy": 0.2348609700105911, + "eval_loss": 0.9410302639007568, + "eval_mean_token_accuracy": 0.8523409498292346, + "eval_num_tokens": 9199382.0, + "eval_runtime": 85.9105, + "eval_samples_per_second": 16.005, + "eval_steps_per_second": 2.002, + "step": 3940 + }, + { + "entropy": 0.11162231937050819, + "epoch": 9.851805728518057, + "grad_norm": 0.13079790771007538, + "learning_rate": 1.5867404281932237e-07, + "loss": 0.05349419116973877, + "mean_token_accuracy": 0.9791230395436287, + "num_tokens": 9251912.0, + "step": 3960 + }, + { + "epoch": 9.851805728518057, + "eval_entropy": 0.23484029950097549, + "eval_loss": 0.9411523342132568, + "eval_mean_token_accuracy": 0.8523351938225502, + "eval_num_tokens": 9251912.0, + "eval_runtime": 85.1298, + "eval_samples_per_second": 16.152, + "eval_steps_per_second": 2.02, + "step": 3960 + }, + { + "entropy": 0.12446248792111873, + "epoch": 9.90161892901619, + "grad_norm": 0.1705058217048645, + "learning_rate": 7.16918189283218e-08, + "loss": 0.061916273832321164, + "mean_token_accuracy": 0.9767685994505882, + "num_tokens": 9296482.0, + "step": 3980 + }, + { + "epoch": 9.90161892901619, + "eval_entropy": 0.2347967088395773, + "eval_loss": 0.9411665201187134, + "eval_mean_token_accuracy": 0.8524297087691551, + "eval_num_tokens": 9296482.0, + "eval_runtime": 86.2026, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 3980 + }, + { + "entropy": 0.13053828622214497, + "epoch": 9.951432129514322, + "grad_norm": 0.1882583051919937, + "learning_rate": 1.8809372719714117e-08, + "loss": 0.06384563446044922, + "mean_token_accuracy": 0.9753879077732563, + "num_tokens": 9341118.0, + "step": 4000 + }, + { + "epoch": 9.951432129514322, + "eval_entropy": 0.23490050339768098, + "eval_loss": 0.9411982297897339, + "eval_mean_token_accuracy": 0.8522821709860203, + "eval_num_tokens": 9341118.0, + "eval_runtime": 86.5264, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 4000 + }, + { + "entropy": 0.1327908534843188, + "epoch": 10.0, + "grad_norm": 0.29403096437454224, + "learning_rate": 4.2652817989878134e-11, + "loss": 0.059251207113265994, + "mean_token_accuracy": 0.9757734407217075, + "num_tokens": 9386580.0, + "step": 4020 + }, + { + "epoch": 10.0, + "eval_entropy": 0.23489686595492584, + "eval_loss": 0.9411709904670715, + "eval_mean_token_accuracy": 0.8524181870527046, + "eval_num_tokens": 9386580.0, + "eval_runtime": 86.0874, + "eval_samples_per_second": 15.972, + "eval_steps_per_second": 1.998, + "step": 4020 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": true + }, + "attributes": {} + } + }, + "total_flos": 3.964083844973138e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-420/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-420/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-420/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-420/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-420/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-420/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-420/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-420/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-420/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-420/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-420/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-420/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-420/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-420/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..c0a3d4e6feec03c88f56611acd0f157a83cecd23 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-420/trainer_state.json @@ -0,0 +1,475 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 1.0448318804483188, + "eval_steps": 20, + "global_step": 420, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 4.155416952633139e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-440/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-440/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-440/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-440/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-440/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-440/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-440/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-440/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-440/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-440/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-440/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-440/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-440/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-440/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..a242b67a0860cfea46ff4b66f1b3d40a95a5ec44 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-440/trainer_state.json @@ -0,0 +1,496 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 1.0946450809464507, + "eval_steps": 20, + "global_step": 440, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 4.352373181726925e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-460/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-460/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-460/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-460/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-460/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-460/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-460/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-460/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-460/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-460/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-460/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-460/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-460/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-460/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..eff97ae7ce361c37a9d856c9d0a9610a0689b070 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-460/trainer_state.json @@ -0,0 +1,517 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 1.1444582814445827, + "eval_steps": 20, + "global_step": 460, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 4.572855012445594e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-480/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-480/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-480/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-480/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-480/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-480/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-480/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-480/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-480/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-480/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-480/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-480/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-480/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-480/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..e6f4baf01ccf7c7ae92c77395ef4ced08db8968a --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-480/trainer_state.json @@ -0,0 +1,538 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 1.1942714819427147, + "eval_steps": 20, + "global_step": 480, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 4.77945126296064e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-500/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-500/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-500/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-500/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-500/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-500/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-500/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-500/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-500/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-500/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-500/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-500/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-500/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-500/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..2133c2164c1e9050872ce5895ff8f211776ef11f --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-500/trainer_state.json @@ -0,0 +1,559 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 1.244084682440847, + "eval_steps": 20, + "global_step": 500, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 4.964191412767334e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-520/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-520/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-520/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-520/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-520/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-520/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-520/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-520/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-520/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-520/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-520/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-520/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-520/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-520/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..37d8033c2ad3a80d2c22f5bb3f8bb5b452760a76 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-520/trainer_state.json @@ -0,0 +1,580 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 1.293897882938979, + "eval_steps": 20, + "global_step": 520, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 5.160321867214234e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-540/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-540/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-540/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-540/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-540/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-540/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-540/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-540/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-540/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-540/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-540/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-540/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-540/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-540/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..c0227ba6fa0308d5ea09a21d1ad046e27fa86b7b --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-540/trainer_state.json @@ -0,0 +1,601 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 1.3437110834371109, + "eval_steps": 20, + "global_step": 540, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 5.344020822900941e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-560/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-560/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-560/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-560/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-560/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-560/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-560/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-560/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-560/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-560/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-560/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-560/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-560/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-560/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..250779e39b5be85845e766c9abddb99f0d3563e5 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-560/trainer_state.json @@ -0,0 +1,622 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 1.3935242839352429, + "eval_steps": 20, + "global_step": 560, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 5.543921118127104e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-580/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-580/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-580/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-580/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-580/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-580/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-580/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-580/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-580/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-580/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-580/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-580/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-580/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-580/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..aa06579e5168d43db1d5ea2fd207708bc88c4940 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-580/trainer_state.json @@ -0,0 +1,643 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 1.4433374844333748, + "eval_steps": 20, + "global_step": 580, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 5.739225797927117e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-60/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-60/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-60/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-60/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-60/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-60/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-60/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-60/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-60/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-60/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-60/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-60/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-60/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-60/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..b37bba4dec5eda89a0974d894feebb1840d1a341 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-60/trainer_state.json @@ -0,0 +1,97 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 0.149439601494396, + "eval_steps": 20, + "global_step": 60, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 5653773829644288.0, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-600/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-600/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-600/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-600/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-600/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-600/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-600/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-600/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-600/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-600/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-600/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-600/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-600/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-600/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..8a1980ad266266897a7926ab36e4ece2f57301c2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-600/trainer_state.json @@ -0,0 +1,664 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 1.4931506849315068, + "eval_steps": 20, + "global_step": 600, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 5.93531137331712e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-620/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-620/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-620/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-620/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-620/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-620/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-620/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-620/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-620/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-620/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-620/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-620/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-620/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-620/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..a7ad7873298c0936f72d44a8c30749914d3b6c30 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-620/trainer_state.json @@ -0,0 +1,685 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 1.5429638854296388, + "eval_steps": 20, + "global_step": 620, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 6.147230279980032e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-640/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-640/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-640/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-640/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-640/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-640/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-640/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-640/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-640/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-640/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-640/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-640/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-640/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-640/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..fbb57807b9fb3c69aebdedd79e33236979915ca8 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-640/trainer_state.json @@ -0,0 +1,706 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 1.592777085927771, + "eval_steps": 20, + "global_step": 640, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 6.338594578584576e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-660/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-660/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-660/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-660/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-660/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-660/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-660/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-660/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-660/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-660/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-660/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-660/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-660/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-660/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..6ae83ae83d0886071cab45a575474461870b6191 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-660/trainer_state.json @@ -0,0 +1,727 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 1.6425902864259028, + "eval_steps": 20, + "global_step": 660, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 6.516450281063424e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-680/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-680/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-680/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-680/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-680/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-680/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-680/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-680/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-680/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-680/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-680/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-680/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-680/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-680/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..988d360a2d02fb6a3da0a0590161c4c2e57bfef7 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-680/trainer_state.json @@ -0,0 +1,748 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 1.692403486924035, + "eval_steps": 20, + "global_step": 680, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 6.728503824897024e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-700/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-700/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-700/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-700/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-700/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-700/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-700/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-700/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-700/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-700/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-700/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-700/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-700/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-700/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..41394ac4edb51ad7d42d375feef63728b399e67b --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-700/trainer_state.json @@ -0,0 +1,769 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 1.7422166874221667, + "eval_steps": 20, + "global_step": 700, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 6.93499236567552e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-720/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-720/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-720/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-720/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-720/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-720/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-720/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-720/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-720/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-720/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-720/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-720/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-720/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-720/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..1ee32bba65ed1d5f91fef859c85d69f8a8a47140 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-720/trainer_state.json @@ -0,0 +1,790 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 1.792029887920299, + "eval_steps": 20, + "global_step": 720, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 7.120576241751859e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-740/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-740/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-740/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-740/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-740/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-740/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-740/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-740/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-740/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-740/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-740/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-740/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-740/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-740/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..6e707c52c7c8f77754359ded2aed88e806c1782a --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-740/trainer_state.json @@ -0,0 +1,811 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 1.841843088418431, + "eval_steps": 20, + "global_step": 740, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 7.32430920843694e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-760/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-760/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-760/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-760/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-760/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-760/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-760/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-760/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-760/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-760/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-760/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-760/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-760/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-760/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..c2913162aa55ec3cf060cff741c07c94d7bbae36 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-760/trainer_state.json @@ -0,0 +1,832 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 1.891656288916563, + "eval_steps": 20, + "global_step": 760, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + }, + { + "entropy": 0.561330484598875, + "epoch": 1.891656288916563, + "grad_norm": 0.6722865700721741, + "learning_rate": 0.0002208867897174789, + "loss": 0.499837589263916, + "mean_token_accuracy": 0.8518734864890576, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.5865232653396074, + "eval_loss": 0.5437926650047302, + "eval_mean_token_accuracy": 0.8450997017843779, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4116, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 760 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 7.507783768839168e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-780/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-780/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-780/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-780/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-780/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-780/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-780/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-780/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-780/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-780/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-780/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-780/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-780/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-780/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..020d2663dc76d96cd13dc39a90a5578eff6cf297 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-780/trainer_state.json @@ -0,0 +1,853 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 1.9414694894146949, + "eval_steps": 20, + "global_step": 780, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + }, + { + "entropy": 0.561330484598875, + "epoch": 1.891656288916563, + "grad_norm": 0.6722865700721741, + "learning_rate": 0.0002208867897174789, + "loss": 0.499837589263916, + "mean_token_accuracy": 0.8518734864890576, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.5865232653396074, + "eval_loss": 0.5437926650047302, + "eval_mean_token_accuracy": 0.8450997017843779, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4116, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.547389242425561, + "epoch": 1.9414694894146949, + "grad_norm": 0.7935577034950256, + "learning_rate": 0.00022027119820226907, + "loss": 0.4977591514587402, + "mean_token_accuracy": 0.8539491161704064, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.5290903090391048, + "eval_loss": 0.5409526824951172, + "eval_mean_token_accuracy": 0.8497545698354411, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.7262, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 780 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 7.706427450472243e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-80/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-80/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-80/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-80/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-80/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-80/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-80/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-80/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-80/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-80/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-80/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-80/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-80/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-80/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..4f69e16ee9b7e91bf931d4d1a703bd2a30318af2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-80/trainer_state.json @@ -0,0 +1,118 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 0.199252801992528, + "eval_steps": 20, + "global_step": 80, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 7798902991159296.0, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-800/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-800/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-800/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-800/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-800/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-800/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-800/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-800/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-800/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-800/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-800/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-800/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-800/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-800/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..4692d06fe7299372f766ab8095d62e7b9f0e06d5 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-800/trainer_state.json @@ -0,0 +1,874 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 1.9912826899128269, + "eval_steps": 20, + "global_step": 800, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + }, + { + "entropy": 0.561330484598875, + "epoch": 1.891656288916563, + "grad_norm": 0.6722865700721741, + "learning_rate": 0.0002208867897174789, + "loss": 0.499837589263916, + "mean_token_accuracy": 0.8518734864890576, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.5865232653396074, + "eval_loss": 0.5437926650047302, + "eval_mean_token_accuracy": 0.8450997017843779, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4116, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.547389242425561, + "epoch": 1.9414694894146949, + "grad_norm": 0.7935577034950256, + "learning_rate": 0.00022027119820226907, + "loss": 0.4977591514587402, + "mean_token_accuracy": 0.8539491161704064, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.5290903090391048, + "eval_loss": 0.5409526824951172, + "eval_mean_token_accuracy": 0.8497545698354411, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.7262, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 780 + }, + { + "entropy": 0.5687909748405218, + "epoch": 1.9912826899128269, + "grad_norm": 0.6180546283721924, + "learning_rate": 0.00021962329729698345, + "loss": 0.5109643459320068, + "mean_token_accuracy": 0.8521598495543004, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.5503541858390321, + "eval_loss": 0.5361555218696594, + "eval_mean_token_accuracy": 0.8510884285666221, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.3339, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 800 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 7.897684039340237e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-820/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-820/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-820/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-820/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-820/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-820/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-820/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-820/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-820/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-820/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-820/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-820/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-820/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-820/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..975de21d9beed17925bae8047e0658476e033855 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-820/trainer_state.json @@ -0,0 +1,895 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 2.0398505603985058, + "eval_steps": 20, + "global_step": 820, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + }, + { + "entropy": 0.561330484598875, + "epoch": 1.891656288916563, + "grad_norm": 0.6722865700721741, + "learning_rate": 0.0002208867897174789, + "loss": 0.499837589263916, + "mean_token_accuracy": 0.8518734864890576, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.5865232653396074, + "eval_loss": 0.5437926650047302, + "eval_mean_token_accuracy": 0.8450997017843779, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4116, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.547389242425561, + "epoch": 1.9414694894146949, + "grad_norm": 0.7935577034950256, + "learning_rate": 0.00022027119820226907, + "loss": 0.4977591514587402, + "mean_token_accuracy": 0.8539491161704064, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.5290903090391048, + "eval_loss": 0.5409526824951172, + "eval_mean_token_accuracy": 0.8497545698354411, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.7262, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 780 + }, + { + "entropy": 0.5687909748405218, + "epoch": 1.9912826899128269, + "grad_norm": 0.6180546283721924, + "learning_rate": 0.00021962329729698345, + "loss": 0.5109643459320068, + "mean_token_accuracy": 0.8521598495543004, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.5503541858390321, + "eval_loss": 0.5361555218696594, + "eval_mean_token_accuracy": 0.8510884285666221, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.3339, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 800 + }, + { + "entropy": 0.4739728841261986, + "epoch": 2.0398505603985058, + "grad_norm": 0.8058829307556152, + "learning_rate": 0.0002189432823996982, + "loss": 0.4204097747802734, + "mean_token_accuracy": 0.8728981889211215, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.5077334992414297, + "eval_loss": 0.5531114339828491, + "eval_mean_token_accuracy": 0.8489257208136625, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.4801, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.989, + "step": 820 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 8.08591129186775e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-840/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-840/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-840/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-840/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-840/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-840/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-840/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-840/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-840/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-840/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-840/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-840/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-840/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-840/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..30c69ef80eb9fcf466ce3b39d1336bc4e7bd7ced --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-840/trainer_state.json @@ -0,0 +1,916 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 2.0896637608966375, + "eval_steps": 20, + "global_step": 840, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + }, + { + "entropy": 0.561330484598875, + "epoch": 1.891656288916563, + "grad_norm": 0.6722865700721741, + "learning_rate": 0.0002208867897174789, + "loss": 0.499837589263916, + "mean_token_accuracy": 0.8518734864890576, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.5865232653396074, + "eval_loss": 0.5437926650047302, + "eval_mean_token_accuracy": 0.8450997017843779, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4116, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.547389242425561, + "epoch": 1.9414694894146949, + "grad_norm": 0.7935577034950256, + "learning_rate": 0.00022027119820226907, + "loss": 0.4977591514587402, + "mean_token_accuracy": 0.8539491161704064, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.5290903090391048, + "eval_loss": 0.5409526824951172, + "eval_mean_token_accuracy": 0.8497545698354411, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.7262, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 780 + }, + { + "entropy": 0.5687909748405218, + "epoch": 1.9912826899128269, + "grad_norm": 0.6180546283721924, + "learning_rate": 0.00021962329729698345, + "loss": 0.5109643459320068, + "mean_token_accuracy": 0.8521598495543004, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.5503541858390321, + "eval_loss": 0.5361555218696594, + "eval_mean_token_accuracy": 0.8510884285666221, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.3339, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 800 + }, + { + "entropy": 0.4739728841261986, + "epoch": 2.0398505603985058, + "grad_norm": 0.8058829307556152, + "learning_rate": 0.0002189432823996982, + "loss": 0.4204097747802734, + "mean_token_accuracy": 0.8728981889211215, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.5077334992414297, + "eval_loss": 0.5531114339828491, + "eval_mean_token_accuracy": 0.8489257208136625, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.4801, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.989, + "step": 820 + }, + { + "entropy": 0.4594309840351343, + "epoch": 2.0896637608966375, + "grad_norm": 0.6906896829605103, + "learning_rate": 0.0002182313585936314, + "loss": 0.4071959495544434, + "mean_token_accuracy": 0.8732857562601566, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.49850136994622474, + "eval_loss": 0.5486204624176025, + "eval_mean_token_accuracy": 0.8507991450470548, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.3364, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 840 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 8.296977496449638e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-860/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-860/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-860/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-860/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-860/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-860/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-860/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-860/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-860/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-860/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-860/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-860/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-860/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-860/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..6bedf650e993099d83d679fce5d23b944c11169b --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-860/trainer_state.json @@ -0,0 +1,937 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 2.1394769613947697, + "eval_steps": 20, + "global_step": 860, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + }, + { + "entropy": 0.561330484598875, + "epoch": 1.891656288916563, + "grad_norm": 0.6722865700721741, + "learning_rate": 0.0002208867897174789, + "loss": 0.499837589263916, + "mean_token_accuracy": 0.8518734864890576, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.5865232653396074, + "eval_loss": 0.5437926650047302, + "eval_mean_token_accuracy": 0.8450997017843779, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4116, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.547389242425561, + "epoch": 1.9414694894146949, + "grad_norm": 0.7935577034950256, + "learning_rate": 0.00022027119820226907, + "loss": 0.4977591514587402, + "mean_token_accuracy": 0.8539491161704064, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.5290903090391048, + "eval_loss": 0.5409526824951172, + "eval_mean_token_accuracy": 0.8497545698354411, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.7262, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 780 + }, + { + "entropy": 0.5687909748405218, + "epoch": 1.9912826899128269, + "grad_norm": 0.6180546283721924, + "learning_rate": 0.00021962329729698345, + "loss": 0.5109643459320068, + "mean_token_accuracy": 0.8521598495543004, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.5503541858390321, + "eval_loss": 0.5361555218696594, + "eval_mean_token_accuracy": 0.8510884285666221, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.3339, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 800 + }, + { + "entropy": 0.4739728841261986, + "epoch": 2.0398505603985058, + "grad_norm": 0.8058829307556152, + "learning_rate": 0.0002189432823996982, + "loss": 0.4204097747802734, + "mean_token_accuracy": 0.8728981889211215, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.5077334992414297, + "eval_loss": 0.5531114339828491, + "eval_mean_token_accuracy": 0.8489257208136625, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.4801, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.989, + "step": 820 + }, + { + "entropy": 0.4594309840351343, + "epoch": 2.0896637608966375, + "grad_norm": 0.6906896829605103, + "learning_rate": 0.0002182313585936314, + "loss": 0.4071959495544434, + "mean_token_accuracy": 0.8732857562601566, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.49850136994622474, + "eval_loss": 0.5486204624176025, + "eval_mean_token_accuracy": 0.8507991450470548, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.3364, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.4881629109382629, + "epoch": 2.1394769613947697, + "grad_norm": 0.6343470215797424, + "learning_rate": 0.0002174877405852928, + "loss": 0.41669540405273436, + "mean_token_accuracy": 0.8711295068264008, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.49155513924914734, + "eval_loss": 0.555109441280365, + "eval_mean_token_accuracy": 0.8496399400539176, + "eval_num_tokens": 2008562.0, + "eval_runtime": 86.3295, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 860 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 8.478540209028096e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-880/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-880/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-880/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-880/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-880/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-880/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-880/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-880/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-880/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-880/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-880/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-880/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-880/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-880/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..dc2f41cfb549a33778ae4439584a8937d7530bf9 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-880/trainer_state.json @@ -0,0 +1,958 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 2.1892901618929015, + "eval_steps": 20, + "global_step": 880, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + }, + { + "entropy": 0.561330484598875, + "epoch": 1.891656288916563, + "grad_norm": 0.6722865700721741, + "learning_rate": 0.0002208867897174789, + "loss": 0.499837589263916, + "mean_token_accuracy": 0.8518734864890576, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.5865232653396074, + "eval_loss": 0.5437926650047302, + "eval_mean_token_accuracy": 0.8450997017843779, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4116, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.547389242425561, + "epoch": 1.9414694894146949, + "grad_norm": 0.7935577034950256, + "learning_rate": 0.00022027119820226907, + "loss": 0.4977591514587402, + "mean_token_accuracy": 0.8539491161704064, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.5290903090391048, + "eval_loss": 0.5409526824951172, + "eval_mean_token_accuracy": 0.8497545698354411, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.7262, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 780 + }, + { + "entropy": 0.5687909748405218, + "epoch": 1.9912826899128269, + "grad_norm": 0.6180546283721924, + "learning_rate": 0.00021962329729698345, + "loss": 0.5109643459320068, + "mean_token_accuracy": 0.8521598495543004, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.5503541858390321, + "eval_loss": 0.5361555218696594, + "eval_mean_token_accuracy": 0.8510884285666221, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.3339, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 800 + }, + { + "entropy": 0.4739728841261986, + "epoch": 2.0398505603985058, + "grad_norm": 0.8058829307556152, + "learning_rate": 0.0002189432823996982, + "loss": 0.4204097747802734, + "mean_token_accuracy": 0.8728981889211215, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.5077334992414297, + "eval_loss": 0.5531114339828491, + "eval_mean_token_accuracy": 0.8489257208136625, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.4801, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.989, + "step": 820 + }, + { + "entropy": 0.4594309840351343, + "epoch": 2.0896637608966375, + "grad_norm": 0.6906896829605103, + "learning_rate": 0.0002182313585936314, + "loss": 0.4071959495544434, + "mean_token_accuracy": 0.8732857562601566, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.49850136994622474, + "eval_loss": 0.5486204624176025, + "eval_mean_token_accuracy": 0.8507991450470548, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.3364, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.4881629109382629, + "epoch": 2.1394769613947697, + "grad_norm": 0.6343470215797424, + "learning_rate": 0.0002174877405852928, + "loss": 0.41669540405273436, + "mean_token_accuracy": 0.8711295068264008, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.49155513924914734, + "eval_loss": 0.555109441280365, + "eval_mean_token_accuracy": 0.8496399400539176, + "eval_num_tokens": 2008562.0, + "eval_runtime": 86.3295, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 860 + }, + { + "entropy": 0.4648668970912695, + "epoch": 2.1892901618929015, + "grad_norm": 0.8014165163040161, + "learning_rate": 0.00021671265263973133, + "loss": 0.4110250473022461, + "mean_token_accuracy": 0.8754166305065155, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.4909258722219356, + "eval_loss": 0.5539511442184448, + "eval_mean_token_accuracy": 0.8492401502160138, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.3468, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 880 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 8.682066732051456e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-900/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-900/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-900/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-900/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-900/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-900/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-900/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-900/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-900/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-900/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-900/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-900/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-900/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-900/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..cf4ab10a1faee94af32c354905aed625a93cc42b --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-900/trainer_state.json @@ -0,0 +1,979 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 2.2391033623910337, + "eval_steps": 20, + "global_step": 900, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + }, + { + "entropy": 0.561330484598875, + "epoch": 1.891656288916563, + "grad_norm": 0.6722865700721741, + "learning_rate": 0.0002208867897174789, + "loss": 0.499837589263916, + "mean_token_accuracy": 0.8518734864890576, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.5865232653396074, + "eval_loss": 0.5437926650047302, + "eval_mean_token_accuracy": 0.8450997017843779, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4116, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.547389242425561, + "epoch": 1.9414694894146949, + "grad_norm": 0.7935577034950256, + "learning_rate": 0.00022027119820226907, + "loss": 0.4977591514587402, + "mean_token_accuracy": 0.8539491161704064, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.5290903090391048, + "eval_loss": 0.5409526824951172, + "eval_mean_token_accuracy": 0.8497545698354411, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.7262, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 780 + }, + { + "entropy": 0.5687909748405218, + "epoch": 1.9912826899128269, + "grad_norm": 0.6180546283721924, + "learning_rate": 0.00021962329729698345, + "loss": 0.5109643459320068, + "mean_token_accuracy": 0.8521598495543004, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.5503541858390321, + "eval_loss": 0.5361555218696594, + "eval_mean_token_accuracy": 0.8510884285666221, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.3339, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 800 + }, + { + "entropy": 0.4739728841261986, + "epoch": 2.0398505603985058, + "grad_norm": 0.8058829307556152, + "learning_rate": 0.0002189432823996982, + "loss": 0.4204097747802734, + "mean_token_accuracy": 0.8728981889211215, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.5077334992414297, + "eval_loss": 0.5531114339828491, + "eval_mean_token_accuracy": 0.8489257208136625, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.4801, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.989, + "step": 820 + }, + { + "entropy": 0.4594309840351343, + "epoch": 2.0896637608966375, + "grad_norm": 0.6906896829605103, + "learning_rate": 0.0002182313585936314, + "loss": 0.4071959495544434, + "mean_token_accuracy": 0.8732857562601566, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.49850136994622474, + "eval_loss": 0.5486204624176025, + "eval_mean_token_accuracy": 0.8507991450470548, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.3364, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.4881629109382629, + "epoch": 2.1394769613947697, + "grad_norm": 0.6343470215797424, + "learning_rate": 0.0002174877405852928, + "loss": 0.41669540405273436, + "mean_token_accuracy": 0.8711295068264008, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.49155513924914734, + "eval_loss": 0.555109441280365, + "eval_mean_token_accuracy": 0.8496399400539176, + "eval_num_tokens": 2008562.0, + "eval_runtime": 86.3295, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 860 + }, + { + "entropy": 0.4648668970912695, + "epoch": 2.1892901618929015, + "grad_norm": 0.8014165163040161, + "learning_rate": 0.00021671265263973133, + "loss": 0.4110250473022461, + "mean_token_accuracy": 0.8754166305065155, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.4909258722219356, + "eval_loss": 0.5539511442184448, + "eval_mean_token_accuracy": 0.8492401502160138, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.3468, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 880 + }, + { + "entropy": 0.4824485514312983, + "epoch": 2.2391033623910337, + "grad_norm": 0.6665191054344177, + "learning_rate": 0.00021590632851289967, + "loss": 0.4181404113769531, + "mean_token_accuracy": 0.8726993151009083, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.4986876940657926, + "eval_loss": 0.547695517539978, + "eval_mean_token_accuracy": 0.8501384708770486, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.3838, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 900 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 8.875351854291149e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-920/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-920/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-920/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-920/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-920/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-920/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-920/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-920/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-920/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-920/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-920/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-920/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-920/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-920/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..02c861e2f86988ed4546111ad25433ea8b457c55 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-920/trainer_state.json @@ -0,0 +1,1000 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 2.2889165628891655, + "eval_steps": 20, + "global_step": 920, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + }, + { + "entropy": 0.561330484598875, + "epoch": 1.891656288916563, + "grad_norm": 0.6722865700721741, + "learning_rate": 0.0002208867897174789, + "loss": 0.499837589263916, + "mean_token_accuracy": 0.8518734864890576, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.5865232653396074, + "eval_loss": 0.5437926650047302, + "eval_mean_token_accuracy": 0.8450997017843779, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4116, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.547389242425561, + "epoch": 1.9414694894146949, + "grad_norm": 0.7935577034950256, + "learning_rate": 0.00022027119820226907, + "loss": 0.4977591514587402, + "mean_token_accuracy": 0.8539491161704064, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.5290903090391048, + "eval_loss": 0.5409526824951172, + "eval_mean_token_accuracy": 0.8497545698354411, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.7262, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 780 + }, + { + "entropy": 0.5687909748405218, + "epoch": 1.9912826899128269, + "grad_norm": 0.6180546283721924, + "learning_rate": 0.00021962329729698345, + "loss": 0.5109643459320068, + "mean_token_accuracy": 0.8521598495543004, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.5503541858390321, + "eval_loss": 0.5361555218696594, + "eval_mean_token_accuracy": 0.8510884285666221, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.3339, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 800 + }, + { + "entropy": 0.4739728841261986, + "epoch": 2.0398505603985058, + "grad_norm": 0.8058829307556152, + "learning_rate": 0.0002189432823996982, + "loss": 0.4204097747802734, + "mean_token_accuracy": 0.8728981889211215, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.5077334992414297, + "eval_loss": 0.5531114339828491, + "eval_mean_token_accuracy": 0.8489257208136625, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.4801, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.989, + "step": 820 + }, + { + "entropy": 0.4594309840351343, + "epoch": 2.0896637608966375, + "grad_norm": 0.6906896829605103, + "learning_rate": 0.0002182313585936314, + "loss": 0.4071959495544434, + "mean_token_accuracy": 0.8732857562601566, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.49850136994622474, + "eval_loss": 0.5486204624176025, + "eval_mean_token_accuracy": 0.8507991450470548, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.3364, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.4881629109382629, + "epoch": 2.1394769613947697, + "grad_norm": 0.6343470215797424, + "learning_rate": 0.0002174877405852928, + "loss": 0.41669540405273436, + "mean_token_accuracy": 0.8711295068264008, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.49155513924914734, + "eval_loss": 0.555109441280365, + "eval_mean_token_accuracy": 0.8496399400539176, + "eval_num_tokens": 2008562.0, + "eval_runtime": 86.3295, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 860 + }, + { + "entropy": 0.4648668970912695, + "epoch": 2.1892901618929015, + "grad_norm": 0.8014165163040161, + "learning_rate": 0.00021671265263973133, + "loss": 0.4110250473022461, + "mean_token_accuracy": 0.8754166305065155, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.4909258722219356, + "eval_loss": 0.5539511442184448, + "eval_mean_token_accuracy": 0.8492401502160138, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.3468, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 880 + }, + { + "entropy": 0.4824485514312983, + "epoch": 2.2391033623910337, + "grad_norm": 0.6665191054344177, + "learning_rate": 0.00021590632851289967, + "loss": 0.4181404113769531, + "mean_token_accuracy": 0.8726993151009083, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.4986876940657926, + "eval_loss": 0.547695517539978, + "eval_mean_token_accuracy": 0.8501384708770486, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.3838, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 900 + }, + { + "entropy": 0.4751896943897009, + "epoch": 2.2889165628891655, + "grad_norm": 0.81158047914505, + "learning_rate": 0.00021506901138115678, + "loss": 0.40689678192138673, + "mean_token_accuracy": 0.8745221219956875, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.507153491121392, + "eval_loss": 0.5501641631126404, + "eval_mean_token_accuracy": 0.8495670116918032, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.0912, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 920 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 9.073672406714573e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-940/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-940/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-940/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-940/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-940/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-940/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-940/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-940/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-940/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-940/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-940/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-940/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-940/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-940/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..6654eefea15fe79488284643fec786dac2bff768 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-940/trainer_state.json @@ -0,0 +1,1021 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 2.3387297633872977, + "eval_steps": 20, + "global_step": 940, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + }, + { + "entropy": 0.561330484598875, + "epoch": 1.891656288916563, + "grad_norm": 0.6722865700721741, + "learning_rate": 0.0002208867897174789, + "loss": 0.499837589263916, + "mean_token_accuracy": 0.8518734864890576, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.5865232653396074, + "eval_loss": 0.5437926650047302, + "eval_mean_token_accuracy": 0.8450997017843779, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4116, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.547389242425561, + "epoch": 1.9414694894146949, + "grad_norm": 0.7935577034950256, + "learning_rate": 0.00022027119820226907, + "loss": 0.4977591514587402, + "mean_token_accuracy": 0.8539491161704064, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.5290903090391048, + "eval_loss": 0.5409526824951172, + "eval_mean_token_accuracy": 0.8497545698354411, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.7262, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 780 + }, + { + "entropy": 0.5687909748405218, + "epoch": 1.9912826899128269, + "grad_norm": 0.6180546283721924, + "learning_rate": 0.00021962329729698345, + "loss": 0.5109643459320068, + "mean_token_accuracy": 0.8521598495543004, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.5503541858390321, + "eval_loss": 0.5361555218696594, + "eval_mean_token_accuracy": 0.8510884285666221, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.3339, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 800 + }, + { + "entropy": 0.4739728841261986, + "epoch": 2.0398505603985058, + "grad_norm": 0.8058829307556152, + "learning_rate": 0.0002189432823996982, + "loss": 0.4204097747802734, + "mean_token_accuracy": 0.8728981889211215, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.5077334992414297, + "eval_loss": 0.5531114339828491, + "eval_mean_token_accuracy": 0.8489257208136625, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.4801, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.989, + "step": 820 + }, + { + "entropy": 0.4594309840351343, + "epoch": 2.0896637608966375, + "grad_norm": 0.6906896829605103, + "learning_rate": 0.0002182313585936314, + "loss": 0.4071959495544434, + "mean_token_accuracy": 0.8732857562601566, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.49850136994622474, + "eval_loss": 0.5486204624176025, + "eval_mean_token_accuracy": 0.8507991450470548, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.3364, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.4881629109382629, + "epoch": 2.1394769613947697, + "grad_norm": 0.6343470215797424, + "learning_rate": 0.0002174877405852928, + "loss": 0.41669540405273436, + "mean_token_accuracy": 0.8711295068264008, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.49155513924914734, + "eval_loss": 0.555109441280365, + "eval_mean_token_accuracy": 0.8496399400539176, + "eval_num_tokens": 2008562.0, + "eval_runtime": 86.3295, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 860 + }, + { + "entropy": 0.4648668970912695, + "epoch": 2.1892901618929015, + "grad_norm": 0.8014165163040161, + "learning_rate": 0.00021671265263973133, + "loss": 0.4110250473022461, + "mean_token_accuracy": 0.8754166305065155, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.4909258722219356, + "eval_loss": 0.5539511442184448, + "eval_mean_token_accuracy": 0.8492401502160138, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.3468, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 880 + }, + { + "entropy": 0.4824485514312983, + "epoch": 2.2391033623910337, + "grad_norm": 0.6665191054344177, + "learning_rate": 0.00021590632851289967, + "loss": 0.4181404113769531, + "mean_token_accuracy": 0.8726993151009083, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.4986876940657926, + "eval_loss": 0.547695517539978, + "eval_mean_token_accuracy": 0.8501384708770486, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.3838, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 900 + }, + { + "entropy": 0.4751896943897009, + "epoch": 2.2889165628891655, + "grad_norm": 0.81158047914505, + "learning_rate": 0.00021506901138115678, + "loss": 0.40689678192138673, + "mean_token_accuracy": 0.8745221219956875, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.507153491121392, + "eval_loss": 0.5501641631126404, + "eval_mean_token_accuracy": 0.8495670116918032, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.0912, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 920 + }, + { + "entropy": 0.4873133715242147, + "epoch": 2.3387297633872977, + "grad_norm": 0.7218056321144104, + "learning_rate": 0.0002142009537679292, + "loss": 0.42701358795166017, + "mean_token_accuracy": 0.8695114746689796, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5202612736543943, + "eval_loss": 0.5491839051246643, + "eval_mean_token_accuracy": 0.8494071208460386, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.1142, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 940 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 9.248826389968282e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-960/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-960/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-960/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-960/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-960/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-960/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-960/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-960/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-960/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-960/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-960/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-960/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-960/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-960/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..f587407e6cf75c66dc09c00848c0b2bfd3e5d353 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-960/trainer_state.json @@ -0,0 +1,1042 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 2.3885429638854294, + "eval_steps": 20, + "global_step": 960, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + }, + { + "entropy": 0.561330484598875, + "epoch": 1.891656288916563, + "grad_norm": 0.6722865700721741, + "learning_rate": 0.0002208867897174789, + "loss": 0.499837589263916, + "mean_token_accuracy": 0.8518734864890576, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.5865232653396074, + "eval_loss": 0.5437926650047302, + "eval_mean_token_accuracy": 0.8450997017843779, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4116, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.547389242425561, + "epoch": 1.9414694894146949, + "grad_norm": 0.7935577034950256, + "learning_rate": 0.00022027119820226907, + "loss": 0.4977591514587402, + "mean_token_accuracy": 0.8539491161704064, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.5290903090391048, + "eval_loss": 0.5409526824951172, + "eval_mean_token_accuracy": 0.8497545698354411, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.7262, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 780 + }, + { + "entropy": 0.5687909748405218, + "epoch": 1.9912826899128269, + "grad_norm": 0.6180546283721924, + "learning_rate": 0.00021962329729698345, + "loss": 0.5109643459320068, + "mean_token_accuracy": 0.8521598495543004, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.5503541858390321, + "eval_loss": 0.5361555218696594, + "eval_mean_token_accuracy": 0.8510884285666221, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.3339, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 800 + }, + { + "entropy": 0.4739728841261986, + "epoch": 2.0398505603985058, + "grad_norm": 0.8058829307556152, + "learning_rate": 0.0002189432823996982, + "loss": 0.4204097747802734, + "mean_token_accuracy": 0.8728981889211215, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.5077334992414297, + "eval_loss": 0.5531114339828491, + "eval_mean_token_accuracy": 0.8489257208136625, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.4801, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.989, + "step": 820 + }, + { + "entropy": 0.4594309840351343, + "epoch": 2.0896637608966375, + "grad_norm": 0.6906896829605103, + "learning_rate": 0.0002182313585936314, + "loss": 0.4071959495544434, + "mean_token_accuracy": 0.8732857562601566, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.49850136994622474, + "eval_loss": 0.5486204624176025, + "eval_mean_token_accuracy": 0.8507991450470548, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.3364, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.4881629109382629, + "epoch": 2.1394769613947697, + "grad_norm": 0.6343470215797424, + "learning_rate": 0.0002174877405852928, + "loss": 0.41669540405273436, + "mean_token_accuracy": 0.8711295068264008, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.49155513924914734, + "eval_loss": 0.555109441280365, + "eval_mean_token_accuracy": 0.8496399400539176, + "eval_num_tokens": 2008562.0, + "eval_runtime": 86.3295, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 860 + }, + { + "entropy": 0.4648668970912695, + "epoch": 2.1892901618929015, + "grad_norm": 0.8014165163040161, + "learning_rate": 0.00021671265263973133, + "loss": 0.4110250473022461, + "mean_token_accuracy": 0.8754166305065155, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.4909258722219356, + "eval_loss": 0.5539511442184448, + "eval_mean_token_accuracy": 0.8492401502160138, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.3468, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 880 + }, + { + "entropy": 0.4824485514312983, + "epoch": 2.2391033623910337, + "grad_norm": 0.6665191054344177, + "learning_rate": 0.00021590632851289967, + "loss": 0.4181404113769531, + "mean_token_accuracy": 0.8726993151009083, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.4986876940657926, + "eval_loss": 0.547695517539978, + "eval_mean_token_accuracy": 0.8501384708770486, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.3838, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 900 + }, + { + "entropy": 0.4751896943897009, + "epoch": 2.2889165628891655, + "grad_norm": 0.81158047914505, + "learning_rate": 0.00021506901138115678, + "loss": 0.40689678192138673, + "mean_token_accuracy": 0.8745221219956875, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.507153491121392, + "eval_loss": 0.5501641631126404, + "eval_mean_token_accuracy": 0.8495670116918032, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.0912, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 920 + }, + { + "entropy": 0.4873133715242147, + "epoch": 2.3387297633872977, + "grad_norm": 0.7218056321144104, + "learning_rate": 0.0002142009537679292, + "loss": 0.42701358795166017, + "mean_token_accuracy": 0.8695114746689796, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5202612736543943, + "eval_loss": 0.5491839051246643, + "eval_mean_token_accuracy": 0.8494071208460386, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.1142, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 940 + }, + { + "entropy": 0.4762951169162989, + "epoch": 2.3885429638854294, + "grad_norm": 0.7194424867630005, + "learning_rate": 0.0002133024174675534, + "loss": 0.42299847602844237, + "mean_token_accuracy": 0.8709790132939815, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4899340462546016, + "eval_loss": 0.5522511601448059, + "eval_mean_token_accuracy": 0.8492208258357159, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.463, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 960 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 9.454911019234714e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-980/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-980/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-980/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-980/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-980/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-980/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-980/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-980/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-980/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-980/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-980/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-980/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-980/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-980/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..c0c4619e989c05ec7b27f97335cf33a4d1ba8645 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-980/trainer_state.json @@ -0,0 +1,1063 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 2.4383561643835616, + "eval_steps": 20, + "global_step": 980, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + }, + { + "entropy": 0.561330484598875, + "epoch": 1.891656288916563, + "grad_norm": 0.6722865700721741, + "learning_rate": 0.0002208867897174789, + "loss": 0.499837589263916, + "mean_token_accuracy": 0.8518734864890576, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.5865232653396074, + "eval_loss": 0.5437926650047302, + "eval_mean_token_accuracy": 0.8450997017843779, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4116, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.547389242425561, + "epoch": 1.9414694894146949, + "grad_norm": 0.7935577034950256, + "learning_rate": 0.00022027119820226907, + "loss": 0.4977591514587402, + "mean_token_accuracy": 0.8539491161704064, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.5290903090391048, + "eval_loss": 0.5409526824951172, + "eval_mean_token_accuracy": 0.8497545698354411, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.7262, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 780 + }, + { + "entropy": 0.5687909748405218, + "epoch": 1.9912826899128269, + "grad_norm": 0.6180546283721924, + "learning_rate": 0.00021962329729698345, + "loss": 0.5109643459320068, + "mean_token_accuracy": 0.8521598495543004, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.5503541858390321, + "eval_loss": 0.5361555218696594, + "eval_mean_token_accuracy": 0.8510884285666221, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.3339, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 800 + }, + { + "entropy": 0.4739728841261986, + "epoch": 2.0398505603985058, + "grad_norm": 0.8058829307556152, + "learning_rate": 0.0002189432823996982, + "loss": 0.4204097747802734, + "mean_token_accuracy": 0.8728981889211215, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.5077334992414297, + "eval_loss": 0.5531114339828491, + "eval_mean_token_accuracy": 0.8489257208136625, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.4801, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.989, + "step": 820 + }, + { + "entropy": 0.4594309840351343, + "epoch": 2.0896637608966375, + "grad_norm": 0.6906896829605103, + "learning_rate": 0.0002182313585936314, + "loss": 0.4071959495544434, + "mean_token_accuracy": 0.8732857562601566, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.49850136994622474, + "eval_loss": 0.5486204624176025, + "eval_mean_token_accuracy": 0.8507991450470548, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.3364, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.4881629109382629, + "epoch": 2.1394769613947697, + "grad_norm": 0.6343470215797424, + "learning_rate": 0.0002174877405852928, + "loss": 0.41669540405273436, + "mean_token_accuracy": 0.8711295068264008, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.49155513924914734, + "eval_loss": 0.555109441280365, + "eval_mean_token_accuracy": 0.8496399400539176, + "eval_num_tokens": 2008562.0, + "eval_runtime": 86.3295, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 860 + }, + { + "entropy": 0.4648668970912695, + "epoch": 2.1892901618929015, + "grad_norm": 0.8014165163040161, + "learning_rate": 0.00021671265263973133, + "loss": 0.4110250473022461, + "mean_token_accuracy": 0.8754166305065155, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.4909258722219356, + "eval_loss": 0.5539511442184448, + "eval_mean_token_accuracy": 0.8492401502160138, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.3468, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 880 + }, + { + "entropy": 0.4824485514312983, + "epoch": 2.2391033623910337, + "grad_norm": 0.6665191054344177, + "learning_rate": 0.00021590632851289967, + "loss": 0.4181404113769531, + "mean_token_accuracy": 0.8726993151009083, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.4986876940657926, + "eval_loss": 0.547695517539978, + "eval_mean_token_accuracy": 0.8501384708770486, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.3838, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 900 + }, + { + "entropy": 0.4751896943897009, + "epoch": 2.2889165628891655, + "grad_norm": 0.81158047914505, + "learning_rate": 0.00021506901138115678, + "loss": 0.40689678192138673, + "mean_token_accuracy": 0.8745221219956875, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.507153491121392, + "eval_loss": 0.5501641631126404, + "eval_mean_token_accuracy": 0.8495670116918032, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.0912, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 920 + }, + { + "entropy": 0.4873133715242147, + "epoch": 2.3387297633872977, + "grad_norm": 0.7218056321144104, + "learning_rate": 0.0002142009537679292, + "loss": 0.42701358795166017, + "mean_token_accuracy": 0.8695114746689796, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5202612736543943, + "eval_loss": 0.5491839051246643, + "eval_mean_token_accuracy": 0.8494071208460386, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.1142, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 940 + }, + { + "entropy": 0.4762951169162989, + "epoch": 2.3885429638854294, + "grad_norm": 0.7194424867630005, + "learning_rate": 0.0002133024174675534, + "loss": 0.42299847602844237, + "mean_token_accuracy": 0.8709790132939815, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4899340462546016, + "eval_loss": 0.5522511601448059, + "eval_mean_token_accuracy": 0.8492208258357159, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.463, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 960 + }, + { + "entropy": 0.49650347977876663, + "epoch": 2.4383561643835616, + "grad_norm": 0.8406022787094116, + "learning_rate": 0.0002123736734663221, + "loss": 0.4275330066680908, + "mean_token_accuracy": 0.8670595556497573, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.49691385654515996, + "eval_loss": 0.5491269826889038, + "eval_mean_token_accuracy": 0.850309816210769, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.17, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 980 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 9.654290717400883e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +}